← AI 기술 레이더
업데이트 소식Google Developers Blog

구글 Gemini 에이전트 성능 평가 서비스 정식 출시

구글이 Gemini Enterprise Agent Platform의 평가 서비스를 정식 출시했으며, 20개 이상의 사전 구축 지표와 커스텀 평가 방법을 통해 에이전트 성능을 일관되게 측정할 수 있습니다. SDK와 CLI 통합, 시뮬레이션 기능, CI 파이프라인 연계로 개발부터 운영까지 평가 프로세스를 자동화할 수 있습니다.

배경부터 차근차근 살펴보기

AI 에이전트를 도입하는 조직이 늘면서 에이전트가 실제로 기대만큼 잘 작동하는지 측정하는 방법이 중요해졌습니다. 지금까지는 개발팀이 평가 방식을 일관되게 유지하기 어려웠고, 로컬 환경과 프로덕션 환경 간 성능 차이를 추적하기도 복잡했습니다.

구글이 정식 출시한 Gemini Enterprise Agent Platform의 평가 서비스는 이 문제를 해결하기 위해 설계되었습니다. 개발 초기부터 프로덕션 운영까지 같은 평가 엔진을 사용하여 에이전트 품질을 일관되게 측정할 수 있으며, 20개 이상의 사전 구축 지표를 기본으로 제공합니다.

이 서비스의 특징은 단순한 지표 제공을 넘어섭니다. 구글은 DeepMind와 함께 만든 적응형 평가 기준을 포함시켰고, 팀이 코드나 LLM 판정자로 커스텀 지표를 정의할 수 있게 했습니다. 이렇게 만든 평가 방법들은 중앙 저장소에 버전 관리되므로 팀 전체가 일관된 기준을 공유할 수 있습니다.

에이전트는 대화 형태로 작동하기 때문에 단순한 입출력 측정만으로는 부족합니다. 평가 서비스는 사용자 행동과 환경을 시뮬레이션하여 복잡한 다중 턴 상호작용을 자동화하고, 이를 CI 파이프라인에 연계함으로써 코드 변경이 에이전트 성능에 미치는 영향을 즉시 감지할 수 있습니다.

개발팀과 의사결정자에게 이 서비스가 중요한 이유는 명확합니다. 에이전트 배포 결정을 추측이나 제한된 테스트가 아닌 체계적인 성능 지표에 근거할 수 있기 때문입니다.

구체적으로 무엇이 달라졌나

  1. 01

    평가 서비스가 정식 출시(GA)되어 프로덕션 용도로 사용 가능해졌습니다.

  2. 02

    20개 이상의 사전 구축 지표를 제공하며, 팀의 필요에 맞춰 코드 기반 또는 LLM 판정자 기반의 커스텀 지표를 추가할 수 있습니다.

  3. 03

    DeepMind와 함께 개발한 적응형 평가 기준(rubric)을 포함하여 평가의 신뢰도를 높였습니다.

  4. 04

    평가 방법을 중앙화된 저장소에 버전 관리하여 팀 전체가 일관된 기준을 공유하고 변경 이력을 추적할 수 있습니다.

  5. 05

    사용자 행동과 환경을 시뮬레이션하는 기능으로 복잡한 다중 턴 테스트를 자동화하고 CI 파이프라인에 통합할 수 있습니다.

  6. 06

    Agent Platform SDK, agents-cli, ADK를 통해 기존 개발 워크플로우에 직접 연계됩니다.

누구에게 어떤 의미가 있나

에이전트 개발팀

로컬 환경에서의 개발과 프로덕션 운영 환경에서 같은 평가 기준을 적용하여 성능 격차를 명확히 파악할 수 있습니다. 또한 코드 변경이 에이전트 성능에 미치는 영향을 CI 파이프라인 단계에서 즉시 확인하고 배포 결정을 내릴 수 있습니다.

IT 운영과 의사결정자

에이전트 배포 시 객관적인 성능 지표를 기반으로 품질 기준을 설정하고 위험도를 판단할 수 있습니다. 운영 중 성능 저하 시 원인을 빠르게 파악하고 개선 효과를 수치로 검증할 수 있습니다.

AI 연구자와 평가 전문가

기존에 여러 도구와 스크립트로 산재되어 있던 평가 기준을 한곳으로 통합하고, 커스텀 평가 로직을 코드나 LLM으로 정의하여 새로운 평가 방법론을 실험할 수 있습니다.

어디에 어떻게 써볼 수 있나

배포 전 성능 품질 검증

에이전트 업데이트를 프로덕션에 배포하기 전에 사전 정의된 평가 지표를 통과해야 한다는 품질 기준을 설정합니다. CI 파이프라인에서 모든 변경이 자동으로 평가되고, 기준 이하 성능이 감지되면 배포가 차단됩니다.

예를 들면
고객 지원 에이전트 업데이트 시 '정확한 답변 비율', '사용자 만족도', '평균 응답 시간' 등 5가지 지표가 모두 이전 버전 수준 이상이어야 배포를 진행하도록 설정합니다.
확인할 결과
배포 후 성능 저하로 인한 사용자 불만을 사전에 방지하고, 성능이 확실히 개선된 변경만 선택적으로 배포할 수 있습니다.

복잡한 다중 턴 상호작용 자동 테스트

에이전트는 사용자와 여러 번 상호작용하면서 맥락을 유지하고 작업을 진행합니다. 평가 서비스의 시뮬레이션 기능으로 다양한 사용자 행동 패턴과 예외 상황을 자동으로 생성하고 테스트합니다.

예를 들면
온라인 쇼핑 에이전트를 '상품 검색→상세 정보 요청→장바구니 추가→결제 진행' 시나리오로 5회 자동 시뮬레이션하고, 각 턴에서의 정확성과 사용자 만족도를 측정합니다.
확인할 결과
수작업 테스트보다 빠르고 반복 가능한 테스트가 가능해지며, 예상하지 못한 사용자 행동에 대한 에이전트 대응을 사전에 검증할 수 있습니다.

팀별 평가 기준 통일 및 개선

평가 지표와 기준을 중앙화된 저장소에 저장하고 버전 관리합니다. 팀이 공통 기준을 공유하면서도 특정 프로젝트나 부서 특화 지표를 추가할 수 있습니다.

예를 들면
회사 전체 에이전트 평가 기준 v1.0에 '정확성', '응답 시간', '안전성' 3개를 정의하고, 금융팀은 추가로 '규제 준수' 지표를 v1.1에 포함시킵니다. 모든 에이전트는 공통 기준 + 팀 특화 기준으로 평가됩니다.
확인할 결과
팀 간 평가 기준이 일관되어 배포 의사결정이 공정해지고, 기준 변화 이력을 추적하여 성능 개선 효과를 정확히 측정할 수 있습니다.

처음부터 무리하지 말고, 이 순서로 확인하세요

  1. 현재 에이전트 평가 방식 정리하기

    지금 팀이 에이전트 성능을 어떻게 측정하고 있는지 기록합니다. 수작업 테스트인지, 자동화된 지표인지, 또는 사용자 피드백에 의존하는지 확인하고, 각 방식의 한계점(일관성 부족, 시간 소비, 복잡성 등)을 메모합니다.

    확인: 현재 평가 방법 3가지와 각각의 문제점 1~2개씩이 적혀 있는가?

  2. Google Cloud 평가 서비스 문서 검토 및 사전 구축 지표 확인

    공식 문서를 읽고 제공되는 20개 이상의 사전 구축 지표가 무엇인지 확인합니다. 팀의 에이전트 특성(고객 지원, 업무 자동화, 정보 제공 등)에 맞춰 '꼭 필요한 지표', '있으면 좋을 지표', '나중에 검토할 지표' 3가지로 분류합니다.

    확인: 필수 지표 5개 이상을 이름과 정의와 함께 적었는가? '왜 이 지표인가'라는 이유도 메모했는가?

  3. 작은 규모로 평가 서비스 시험 실행

    프로덕션 환경이 아닌 테스트용 에이전트 1개를 선택하여 평가 서비스를 연결합니다. 사전 구축 지표로 평가를 1회 실행하고 결과를 기록합니다. 현재 방식의 결과와 비교하여 차이가 있는지 확인합니다.

    확인: 테스트 에이전트의 평가 결과 리포트(5개 이상 지표)가 생성되었는가? 현재 방식의 평가 결과와 어떤 차이가 있는지 메모했는가?

  4. 팀 기준에 맞춘 커스텀 지표 설계 및 비용 검토

    사전 구축 지표만으로 부족한 부분이 있다면 팀 특화 커스텀 지표를 1~2개 설계합니다. 코드 기반 지표인지, LLM 판정자 기반인지 정합니다. 동시에 평가 서비스 사용 시 예상되는 비용(API 호출, 저장소, 시뮬레이션)을 견적 냅니다.

    확인: 커스텀 지표 설명서 1장이 준비되었는가? 월 예상 비용 범위(최소~최대)가 산출되었는가?

  5. CI 파이프라인 통합 계획 수립 및 적용 결정

    평가 서비스를 코드 변경이 생길 때마다 자동으로 실행하도록 CI 파이프라인에 통합할지 결정합니다. 통합 시점(모든 변경인지, 특정 브랜치인지), 품질 기준(통과/실패 조건), 피드백 방식(로그, 대시보드, 알림)을 팀과 함께 정합니다.

    확인: CI 통합 계획서에 '언제', '무엇을', '기준', '담당자', '예상 효과'가 모두 포함되었는가?

확인된 범위와 아직 모르는 내용을 구분하세요

공식 발표에 따르면 평가 서비스는 정식 출시되었으며, 20개 이상의 사전 구축 지표, DeepMind 기반 적응형 평가 기준, 커스텀 지표 지원, 중앙 저장소 버전 관리, 사용자/환경 시뮬레이터, SDK·CLI·ADK 통합이 가능하다고 명시되어 있습니다. 다만 상세한 지표 목록, 가격 책정, 개인정보 보호 정책, 규제 업계 준수 여부, 다른 클라우드 환경과의 호환성, 기존 평가 도구와의 통합 방법 등은 공식 발표에 포함되지 않았으므로 별도의 문서 검토나 Google Cloud 담당팀 문의를 통해 확인해야 합니다.

  • 평가 서비스의 상세한 가격 책정 방식(API 호출당 비용, 월 구독료, 시뮬레이션 비용 등)이 공식 발표에 명시되지 않았으므로, 실제 도입 전에 Google Cloud 영업팀에 비용 견적을 받아야 합니다.
  • 커스텀 지표를 코드나 LLM으로 정의하는 방법의 학습 곡선이 어느 정도인지, 그리고 기존 LLM 평가 라이브러리와의 호환성이 어느 수준인지 공식 문서만으로는 확인하기 어렵습니다.
  • 평가 서비스에 입력되는 사용자 데이터(대화 기록, 입력 프롬프트 등)가 어떻게 저장·보호·삭제되는지, 그리고 규제 산업(금융, 의료 등)에서 사용 가능한지 확인이 필요합니다.
  • Google Cloud 기반 서비스로 제한되므로, 온프레미스나 다른 클라우드 환경에서 실행되는 에이전트를 평가하려면 추가 작업(데이터 이전, API 연계 등)이 필요할 수 있습니다.
  • 공식 발표 시점 기준 사전 구축 지표 20개의 상세 목록과 각각의 정의·계산 방식이 공식 문서에 제시되어 있는지 확인이 필요하며, 시간이 지나면서 지표가 추가되거나 변경될 가능성이 높습니다.

원문에서 다시 확인하기

이 글은 Google Developers Blog의 공식 발표를 바탕으로 정리했습니다. 기능 범위와 제공 조건은 바뀔 수 있으므로 실제로 적용하기 전에는 원문을 다시 확인해 주세요.

마지막 확인
2026-07-31
다음 검토
2026-08-30

이어 볼 실전 가이드

같은 활용 분야의 소식