에이전트 자동화의 품질은 모델이 아니라 «판정 기준»이 정합니다. 에이전트가 스스로 돌려볼 수 있는 검증 관문을 먼저 붙이면, 사람이 매번 리뷰하는 것보다 결과가 좋아집니다.
에이전트 자동화를 처음 도입하면 대개 이런 순서를 밟습니다. 프롬프트를 다듬고, 결과를 보고, 다시 다듬습니다. 그러다 어느 순간 「괜찮아 보이는데?」 하고 배포합니다. 문제는 그 «괜찮아 보인다»가 사람의 눈으로 몇 건을 본 결과라는 점입니다.
가장 비싼 실패는 「틀린 답」이 아니다
에이전트가 대놓고 실패하면 바로 잡힙니다. 정말 비싼 것은 ***그럴듯한 산출***입니다. 형식이 맞고, 말투가 자연스럽고, 숫자도 들어 있습니다. 그런데 근거가 없습니다. 이건 사람이 100건을 보기 전에는 안 보입니다.
그래서 «자»를 먼저 붙인다
우리는 에이전트를 만들기 전에, 그 에이전트의 산출을 «기계가 판정할 수 있는 관문»부터 만듭니다. 예를 들어 문서 요약 자동화라면 이런 것들입니다.
- 원문에 없는 고유명사가 산출에 등장하면 실패로 센다
- 인용한 문장이 원문에 실제로 있는지 문자열로 대조한다
- 필수 항목(날짜·금액·담당)이 비어 있으면 통과시키지 않는다
- 같은 입력을 두 번 넣어 결과가 다르면 「못 쟀다」로 표시한다
이 관문이 있으면 에이전트가 스스로 돌려보고 고칩니다. 사람이 리뷰 루프를 도는 것보다 훨씬 빠르고, 무엇보다 «놓치지 않습니다».
관측이 없으면 실패가 성공처럼 보인다
실무에서 자주 겪는 함정이 하나 더 있습니다. 검증이 「0건 위반」을 냈는데, 사실은 «아무것도 안 잰» 경우입니다. 분모가 0이면 화면은 초록으로 보입니다. 그래서 우리는 관문마다 «몇 건을 봤는지»를 같이 찍게 합니다. 위반 0 은 그 분모와 함께 읽어야 의미가 있습니다.
권한·로그·롤백은 기능이 아니라 전제다
에이전트가 실제 시스템에 쓰기를 시작하면, 「잘 동작하나」보다 「틀렸을 때 되돌릴 수 있나」가 더 중요해집니다. 그래서 구축 단계에서 권한 범위, 실행 로그, 재시도 규칙, 롤백 경로를 함께 답니다. 이 넷이 없으면 운영에 못 넣습니다.
FAQ
- AI 에이전트 자동화에서 품질을 어떻게 보장하나요?
- 에이전트가 스스로 돌려볼 수 있는 검증 관문을 먼저 만듭니다. 원문 대조, 필수 항목 검사, 재현성 확인 같은 기계 판정 기준을 붙이면 사람이 매번 리뷰하는 것보다 품질이 안정적입니다.
- 「위반 0건」이면 잘 된 건가요?
- 분모를 함께 봐야 합니다. 검증이 아무것도 재지 못했을 때도 위반은 0으로 나옵니다. 관문마다 몇 건을 검사했는지 기록하고, 그 수와 함께 읽어야 합니다.