분별의 인문학

아스트라가 떠안은 책임의 무게

퍼플렉시티가 아스트라라는 모델에게 넘긴 업무 목록은 짧지 않다. 오픈AI가 지난 14일 자사 블로그에서 밝힌 바에 따르면, 퍼플렉시티는 아스트라에게 사내 커뮤니케이션 작성, 소프트웨어 변경, 프로덕션 시스템 모니터링까지 맡겼고, 이전 모델을 쓸 때보다 확인하는 빈도를 크게 줄였다1. 여기서 눈여겨볼 대목은 성능이 얼마나 좋아졌다는 자랑이 아니다. 확인 절차 자체를 줄였다는 결정이다. 사람이 매번 승인하던 자리를 다른 무언가가 대신 메우기 시작했다는 뜻이기 때문이다.

확인 빈도가 낮아진 자리

프로덕션 시스템을 맡긴다는 말은 가볍지 않다. 실제 서비스가 돌아가는 환경에서 코드를 고치고 상태를 지켜보는 일이라, 잘못되면 사용자에게 곧바로 영향이 간다. 그런데도 퍼플렉시티는 확인 빈도를 낮췄다고 밝혔다1. 이 결정은 아스트라의 판단력을 신뢰한다는 뜻이면서, 동시에 그 신뢰를 뒷받침할 다른 장치가 있다는 전제이기도 하다.

사람이 매번 들여다보지 않는다면, 무엇이 그 자리를 대신하는가? 하네스와 데이터 계약, 권한 게이트 같은 제도적 장치다. 이 글이 따라가려는 것은 바로 이 이동이다.

하네스라는 새 심사관

구글 개발자 블로그가 9일 공개한 하네스 엔지니어링 글은 이 제도의 한 축을 보여준다. SWE-bench 같은 종단 간 벤치마크는 점수는 주지만 비용이 크고 느리며, 에이전트 논리가 어디서 어긋났는지는 알려주지 않는다는 지적이다2. 대안으로 제시된 것은 특정 도구 호출이나 파일 수정처럼 중간 행동 하나하나를 검증하는 행동 평가 방식이다.

이 방식이 뜻하는 바는 단순하다. 결과만 보고 통과와 실패를 가르던 심사를, 과정을 하나씩 쪼개 보는 심사로 바꾸겠다는 뜻이다. 사람이 매번 확인하는 대신 이런 세밀한 자동 심사가 통과선을 그어준다면, 확인 빈도를 줄일 근거가 하나 생기는 셈이다. 다만 이 글 자체도 행동 평가가 벤치마크를 완전히 대체할 표준은 아니라고 선을 긋는다2.

데이터에 매기는 자격증

긱뉴스에 소개된 에이전트형 AI 데이터 준비 논의는 같은 문제를 다른 쪽에서 다룬다. 사람의 암묵적 판단에 기대어 굴러가던 데이터 시스템을 에이전트에 그대로 넘길 수 없다는 전제에서 출발해, 데이터 자체에 신뢰성과 맥락, 추적 가능성, 거버넌스, 실행 가능성을 갖추라고 요구한다3. 데이터 계약과 격리 게이트를 통과한 데이터만 에이전트에 노출하자는 제안이다.

이 제안 역시 하네스 논의와 방향이 겹친다. 사람이 일일이 데이터를 검수하는 대신, 데이터 자체에 자격증을 붙여 놓고 그 자격증을 규칙으로 삼자는 발상이다. 확인이라는 행위가 사람에게서 제도로 다시 한번 옮겨가는 장면이다.

되돌아온 승인 창

같은 시기 공개된 클로드 코드의 릴리스 노트는 다른 그림을 보여준다. 앤트로픽이 12일 배포한 2.1.270 버전은, 읽기 전용 git 명령이 세션이 오래 지속되면 뜬금없이 다시 권한을 묻는 회귀 버그를 고쳤다고 밝혔다4. 바로 앞 버전에서 생긴 문제였다.

읽기 전용 명령이 권한을 다시 묻는다는 것은 사소해 보일 수 있다. 하지만 방향을 뒤집어보면 이야기가 달라진다. 권한 게이트라는 제도 장치가 스스로 오작동해, 없어도 될 승인 창을 도로 띄운 사례이기 때문이다. 제도가 사람의 확인을 대신하겠다고 나섰는데, 정작 그 제도 자체에 구멍이 있었다.

옮겨가는 중인 무게

이 네 장면을 나란히 놓으면 그림이 하나로 좁혀진다. 확인이라는 행위는 사람에게서 하네스, 데이터 계약, 권한 게이트라는 제도 쪽으로 옮겨가는 중이다. 퍼플렉시티의 결정은 그 이동이 실제로 일어나고 있다는 근거이고, 하네스 엔지니어링과 데이터 거버넌스 논의는 그 이동을 뒷받침하려는 설계도다. 클로드 코드의 회귀 버그는 그 설계도가 아직 시공 중이라는 사실을 같은 시기에 드러냈을 뿐이다.

나는 이 이동 자체를 반대할 이유는 없다고 본다. 사람이 매번 승인하는 방식은 규모가 커지면 원래 유지되기 어렵다. 문제는 속도다. 권한 체크 하나가 회귀했다는 사실은, 이 제도가 아직 책임을 온전히 감당할 만큼 여물지 않았다는 신호로 읽는 편이 맞다. 퍼플렉시티가 확인 빈도를 줄인 결정이 성급했다고 단정할 근거까지는 없다. 다만 그 결정을 받쳐줄 제도가 지금 얼마나 촘촘한지는 따로 물어야 한다.

이 판단이 흔들릴 지점은 분명하다.

하네스와 데이터 계약, 권한 게이트가 앞으로 몇 달 사이 얼마나 빠르게 다듬어지느냐에 따라, 오늘 내린 이 평가는 지나치게 조심스러웠던 판단으로 뒤집힐 수도 있다. 같은 소식을 지켜본 독자라면, 다음 릴리스 노트와 다음 거버넌스 발표를 함께 세어보며 그 속도를 가늠해보자고 청하고 싶다.

각주

  1. Perplexity trusts GPT-6 Astra with end-to-end systems — openai.com, 2026-09-14 발행, 2026-09-14 접속 확인. 2

  2. The Anatomy of Harness Engineering: How to Evaluate, Iterate, and Guard AI Coding Agents — developers.googleblog.com, 2026-09-09 발행, 2026-09-14 접속 확인. 2

  3. 에이전트형 AI를 위한 데이터 준비하기 — news.hada.io, 2026-09-14 발행, 2026-09-14 접속 확인.

  4. v2.1.270 — github.com, 2026-09-12 발행, 2026-09-14 접속 확인.

신학자이자 AI 교육전문가 이진민

글쓴이 · 이진민

기술의 가능성과 사람의 책임.

조직신학자 · AI 활용 교육전문가

조직신학과 오순절 신학을 연구하고 가르치며, 교회·학교·공공기관에서 생성형 AI 교육과 컨설팅 활동을 합니다. 신학자로서 기술을 읽고, 교육자로서 그것을 현장에서 쓸 수 있는 판단 기준을 고민하고 제시하기 위해 노력합니다.

조직신학 · 오순절 신학AI 리터러시 · 연구와 수업 설계
저자 소개 전체 보기

다음으로 읽을 글

생각의 확장은 질문에서 시작됩니다.

AI 활용 교육 · 2026. 9. 16

자고 일어나면 완성되는 모델의 진실

구글의 자율 학습 파이프라인 발표와 클로드 코드의 릴리스노트를 나란히 놓고, '자율'이라는 말이 실제로 어디까지 검증 가능한 자동화를 뜻하는지 가른다.

다음 글 읽기

주제별 추천

당신에게 매력적인 주제를 골라보세요.

분별의 인문학, AI와 신앙, AI 활용 교육을 각각의 관점과 실천으로 나누어 살펴봅니다.

강의와 컨설팅

조직의 상황에 맞는 AI 활용 기준을 함께 설계합니다.

단순한 도구 소개만 하지 않습니다. 실제 업무, 연구, 수업, 목회 환경에 맞춰 교육 내용과 적용 과정을 구성합니다.

  • 교육기관·공공기관을 위한 AI 리터러시와 업무 적용
  • 연구논문·수업을 위한 생성형 AI 활용 접근법 설계
  • 교회와 목회 현장을 위한 책임 있는 AI 컨설팅

문의에 포함하면 좋은 내용

  1. 기관과 참여 대상
  2. 희망 주제와 기대 결과
  3. 일정·시간·진행 방식
카카오톡으로 강의 문의

제안서·공문·첨부파일은 alive@dia-io.com로 보내주세요.

DiA AI Edu. Solution 소개 ↗