독파모 2차 평가가 시작됐다는 소식이 8월 4일 전해졌습니다. AI타임스는 SKT, LG AI연구원, 업스테이지, 모티프 네 곳이 참여하며, 이번 심사에서는 모델의 절대 성능뿐 아니라 에이전트 성능과 산업 현장 적용도 평가한다고 보도했습니다.1 세부 배점과 검증 방법까지 공개된 것은 아니므로 순위를 예측하기는 이릅니다. 다만 채점 범위가 넓어졌다는 사실은 AI 도구를 고르는 사람에게도 질문 하나를 남깁니다. 좋은 점수를 실제 업무의 신뢰성과 어떻게 연결할 것인가 하는 질문입니다.
에이전트를 채점할 때 보이지 않던 것이 드러납니다
일반적인 질의응답 평가는 입력과 출력만 비교하기 쉽습니다. 에이전트는 그 사이에서 검색하고, 도구를 부르고, 여러 단계를 거쳐 결과를 만듭니다. 최종 답이 맞더라도 엉뚱한 자료를 썼거나 허용하지 않은 행동을 했다면 업무에 그대로 넣기 어렵습니다.
NIST가 2026년 공개한 에이전트 평가 연구도 이 중간 과정을 문제로 삼습니다. 연구진은 에이전트가 사용한 도구와 근거를 추적하고, 사실 주장이 신뢰할 만한 문서에 기대고 있는지 검사하는 평가 장치를 개발하고 있습니다.2 결과 한 줄보다 그 결과가 만들어진 경로를 함께 보려는 시도입니다.
현장과 닮은 시험도 여전히 시험입니다
실제 업무와 비슷한 과제를 쓰면 평가는 한 걸음 나아갑니다. τ-bench는 소매와 항공 업무를 본뜬 환경에서 에이전트가 이용자와 대화하며 도구를 쓰고 업무 규칙을 지키는지 평가합니다. 같은 일을 여러 번 시켰을 때 얼마나 일관되게 성공하는지도 별도 지표로 봅니다.3
이런 벤치마크는 단순 정답률이 놓치는 부분을 보여줍니다. 그래도 특정 시험 환경에서 얻은 점수가 다른 조직의 문서, 권한 체계, 이용자에게 그대로 이어진다고 장담할 수는 없습니다. 독파모의 산업 적용 평가를 읽을 때도 어떤 현장을 골랐는지, 성공 조건을 어떻게 정했는지, 반복 실행에서 얼마나 흔들렸는지를 함께 봐야 합니다.
작은 업무 하나로 다시 채점해 봅니다
교수가 AI 도구로 다음 주 수업의 읽기 안내문을 만든다고 해보겠습니다. 먼저 실제 논문 한 편과 수업 목표를 입력하고 초안을 받은 뒤, 인용된 쪽수와 개념 설명을 원문에 대조합니다. 같은 요청을 다시 보내 빠진 항목이 달라지는지도 기록합니다. 이 짧은 장면에는 정확성뿐 아니라 근거, 반복 안정성, 교사의 수정 부담이 함께 드러납니다.
검사를 한 번에 크게 만들 필요는 없습니다. NIST의 ARIA 시범 평가는 모델 시험, 적대적 점검, 현장 시험을 구분해 AI 애플리케이션을 살폈습니다.4 이 틀을 그대로 복제할 수는 없어도 순서는 참고할 만합니다. 제한된 자료로 먼저 확인하고, 실패하기 쉬운 조건을 일부러 넣어본 다음, 실제 이용 환경에서 생기는 차이를 관찰하는 방식입니다.
순위표가 나온 뒤 확인할 것
독파모 2차 평가 결과가 공개되면 순위보다 평가 설명을 먼저 읽을 필요가 있습니다. 어떤 업무를 맡겼는지, 사람은 어디에서 개입했는지, 실패 사례도 함께 제시했는지가 핵심입니다. 참여 기업이 제출한 성과와 평가자가 확인한 결과도 구분해서 봐야 합니다.
도구를 고르는 사람에게 필요한 결론도 비슷합니다. 공개 점수는 후보를 좁히는 데 쓸 수 있습니다. 최종 선택은 내가 맡길 작은 업무로 다시 채점한 뒤에 내려야 합니다. 현장 평가는 정부 사업의 새 항목인 동시에, 이용자가 제품 설명을 자기 조건에서 검증하는 습관이기도 합니다.
각주
-
독파모 2차 평가 개막...SKT·LG·업스테이지·모티프 ‘4파전’ — www.aitimes.com, 2026-08-04 발행, 2026-08-04 접속 확인. ↩
-
Building Evaluation Probes into Agentic AI — NIST, 2026-05-01 공개, 2026-08-04 접속 확인. 에이전트의 도구 사용과 근거 추적을 평가하는 연구다. ↩
-
τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains — arXiv 공개본, 2024. 이용자 상호작용과 업무 규칙 준수, 반복 성공률을 평가한다. ↩
-
Assessing Risks and Impacts of AI (ARIA): Pilot Evaluation Report — NIST AI 700-2, 2025. 모델 시험·레드팀·현장 시험을 나눈 시범 평가 절차를 설명한다. ↩
