← 블로그 목록

데모는 되는데 운영에서 무너지는 AI, 확률적 결과물을 검수와 계약에 담는 발주 기준

2026.09.295분

데모는 통과했는데, 왜 운영에서 무너질까

AI 도입을 검토하는 대표와 실무자에게 가장 흔한 경험은 이렇습니다. 벤더가 보여준 데모는 매끄럽게 동작했고, 짧은 파일럿도 그럴듯한 결과를 냈습니다. 그런데 실제 업무에 붙이는 순간 응답이 흔들리고, 비용은 예상을 넘고, 틀린 답을 확신에 차서 내놓습니다. 문제는 대체로 모델이 나빠서가 아닙니다.

graphs of performance analytics on a laptop screen

MIT의 Project NANDA가 2025년 8월 발표한 「The GenAI Divide: State of AI in Business 2025」는 기업 300여 건의 도입 사례와 인터뷰, 설문을 분석해, 생성형 AI 파일럿의 약 95%가 측정 가능한 손익 성과를 내지 못했다고 보고했습니다. 핵심 원인으로 지목된 것은 모델 성능이 아니라 업무 워크플로우로의 통합, 학습, 맥락 적응의 부재였습니다. 잘 동작하는 데모와 업무를 실제로 돌리는 시스템은 다른 물건이라는 뜻입니다.

가트너도 2025년 6월 25일 발표에서 에이전틱 AI 프로젝트의 40% 이상이 비용 급증, 불명확한 비즈니스 가치, 부적절한 리스크 통제를 이유로 2027년 말까지 취소될 것으로 전망했습니다. 같은 발표에서 가트너는 기존 챗봇이나 RPA를 실질적 에이전트 기능 없이 재포장하는 '에이전트 워싱'이 확산되고 있으며, 수천 곳의 에이전틱 AI 벤더 중 실제 역량을 갖춘 곳은 약 130곳에 불과하다고 추정했습니다. 발주사 입장에서는 데모의 완성도만으로 벤더 역량을 판단하기 어렵다는 신호입니다.

확률적 결과물은 전통적 검수로 인수할 수 없다

기존 SI 검수는 '명세대로 완벽히 동작하는가'를 봅니다. 같은 입력에 같은 출력이 나오는 결정적 시스템에서는 이 기준이 통합니다. 그러나 AI 결과물은 확률적입니다. 같은 질문에도 답이 달라질 수 있고, 100건 중 몇 건은 반드시 틀립니다. '되느냐 안 되느냐'로 인수하려 하면, 데모에서는 통과하고 운영에서는 매일 새로운 실패를 만나게 됩니다.

S&P Global Market Intelligence가 2025년 북미와 유럽 기업 1,000여 곳을 조사한 결과, AI 이니셔티브 대부분을 폐기한 기업 비율은 2024년 17%에서 2025년 42%로 늘었고, 조직들은 평균적으로 개념검증의 약 46%를 프로덕션 도달 전에 중단했습니다. 주요 장애 요인으로는 비용과 데이터 프라이버시, 보안 위험이 꼽혔습니다. 검수 기준을 '완벽'이 아니라 '허용 가능한 오차 범위와 통제 장치'로 바꿔야 하는 이유가 여기에 있습니다.

black and silver laptop computer

계약과 검수 게이트에 넣어야 할 정량 항목

발주 단계에서 다음 항목을 계약서와 검수 기준에 명시하면, 확률적 결과물도 인수 가능한 형태로 다룰 수 있습니다.

  • 평가셋 기반 정확도 기준: 실제 업무 데이터로 만든 평가셋(테스트 케이스 모음)을 발주사와 벤더가 함께 확정하고, 정답률의 하한선을 인수 조건으로 못박습니다. 데모 화면이 아니라 이 평가셋 통과 여부로 검수합니다.
  • 환각 임계치: 근거 없는 답을 내놓는 비율의 상한을 정하고, 답변에 출처나 근거를 함께 반환하도록 요구합니다. 근거를 제시하지 못할 때는 '모른다'고 답하는 동작을 명세에 포함합니다.
  • 중요 작업의 사람 승인 게이트: 금액 처리, 외부 발송, 데이터 삭제처럼 되돌리기 어려운 작업은 AI가 단독으로 실행하지 못하게 하고, 사람의 확인 단계를 거치도록 설계와 계약에 반영합니다.
  • LLM 비용 상한과 모델 업데이트 조항: 호출량과 월 비용의 상한을 정하고 초과 시 알림과 차단 규칙을 둡니다. 벤더가 쓰는 모델이 바뀌거나 가격이 오를 때의 책임과 재검증 절차를 미리 계약에 적습니다.
  • 운영 중 재평가와 모니터링 SLA: 인수로 끝내지 말고, 운영 중 정확도가 기준 아래로 떨어지면 재평가와 보정을 수행하는 주기와 응답 시간을 SLA로 명시합니다. 입력 데이터가 바뀌면 성능도 변하기 때문입니다.

실무 팁을 덧붙이면, 계약 전에 벤더에게 '데모가 아니라 우리 평가셋으로 수치를 보여달라'고 요구하는 것만으로도 에이전트 워싱을 상당 부분 걸러낼 수 있습니다. 또한 파일럿 예산과 별개로 통합, 모니터링, 재평가에 드는 운영 비용을 처음부터 견적에 포함시켜야 프로덕션 직전에 중단되는 상황을 피할 수 있습니다.

마무리

AI 프로젝트의 성패는 모델이 얼마나 똑똑한가보다, 확률적 결과물을 어떻게 검수하고 통제하며 운영하는가에서 갈립니다. 데모의 완성도가 아니라 평가셋 정확도, 환각 임계치, 사람 승인 게이트, 비용 상한, 재평가 SLA를 계약에 담는 것이 발주사가 리스크를 통제하는 방법입니다. FIRSTPIP은 이런 검수 기준과 운영 설계를 전제로 AI·자동화 솔루션을 구축합니다. 도입을 검토 중이라면 AI·자동화 솔루션 개발 안내를 참고하시기 바랍니다.