앤트로픽 클로드 페이블 5.1, 성능·비용·안전성 분석

Photo of author

By 2Pro

핵심 브리핑

  • Q. 클로드 페이블 5.1은 무엇이 달라졌나?
  • Q. 안전성과 활용 범위는 어떻게 구분되나?
  • 핵심 결론: 페이블 5.1은 성능과 비용 효율을 개선했지만, 자체 평가 수치와 안전장치 적용 범위는 함께 살펴볼 필요가 있다.

클로드 페이블 5.1은 성능을 높이는 동시에 비용과 안전장치의 마찰을 줄였다고 내세운 모델입니다. 자체 평가에서 과학 연구 작업 점수는 52.6%로 전작 24.7%를 크게 앞섰지만, 이 숫자만으로 실제 업무 성과까지 단정하기는 어렵습니다.

페이블 관련 이미지 1

※ AI로 생성한 이미지입니다

이번 공개를 보는 시선은 조금 갈립니다. 앤트로픽은 일반 사용자와 기업이 쓰는 페이블 5.1의 실용성을 강조했고, 다른 한편에서는 접근이 제한된 미토스 5.1을 통해 고성능 모델의 안전 경계를 더 선명하게 드러냈습니다.

페이블 5.1은 성능 상승과 검증 범위를 함께 봐야 합니다

두 참고 자료는 성능 개선을 공통으로 전하지만, 강조점은 다릅니다. 첫 번째 자료는 코딩, 지식 업무, 장시간 에이전트 작업을 넓게 짚습니다. 터미널-벤치-사이언스(Terminal-Bench-Science) 0.1에서 52.6%, 업무 자동화 평가인 오토메이션벤치(AutomationBench)에서 31.4%를 기록했다는 설명이 중심입니다.

두 번째 자료는 과학 연구 평가의 전작 대비 폭을 더 앞세웁니다. 페이블 5의 24.7%와 비교하면 수치 변화가 분명하기 때문입니다. 다만 두 자료 모두 앤트로픽 자체 벤치마크 결과라는 점은 같습니다. 실험실에서 측정한 기록과 각자의 책상 위 업무 결과는 같은 방향일 수는 있어도, 완전히 같은 값은 아닙니다.

지식 업무 평가인 GDPval-AA v2도 1723에서 1853으로 올랐습니다. 숫자는 개선을 가리키지만, 어떤 업종의 어떤 작업에서 시간이 얼마나 줄어드는지는 자료만으로 확인되지 않았습니다.

성능표는 출발점이지, 도착점은 아닙니다.

또 하나의 대비는 안전장치가 점수에 끼치는 영향입니다. 첫 번째 자료는 생산용 안전장치가 개입한 작업을 실패로 처리해 점수가 낮아졌을 가능성을 언급합니다. 실제로 안전장치가 개입한 OSWorld 2.0에서 페이블 5.1과 페이블 5는 0점을 기록했습니다. 높은 점수와 낮은 점수가 한 모델 안에 함께 보이는 이유가 여기 있습니다.

비용을 낮춘 페이블, 긴 작업에서 차이가 커집니다

페이블 관련 이미지 2

※ AI로 생성한 이미지입니다

가격에서는 두 보도가 거의 같은 결론을 냅니다. 캐시 읽기 가격은 100만 토큰당 0.25달러로 75% 인하됐습니다. 캐시 읽기는 이미 처리해 저장한 입력을 다시 읽는 작업입니다. 같은 자료를 여러 번 참고하는 업무라면, 매번 새로 읽는 대신 메모해 둔 서류철을 다시 꺼내 보는 것에 가깝습니다.

항목 페이블 5.1 기준 자료가 전한 변화
캐시 읽기 100만 토큰당 0.25달러 75% 인하
일반 업무 비용 전작 대비 약 25% 절감
도구 호출이 많은 에이전트 업무 전작 대비 최대 45% 절감
입력·출력 가격 100만 토큰당 10달러·50달러 그대로 유지

여기서 중요한 것은 모든 사용자가 같은 폭으로 절감하는 것은 아니라는 점입니다. 캐시를 거의 쓰지 않는 짧은 질의에서는 체감이 작을 수 있습니다. 반대로 긴 문맥을 유지하며 도구를 여러 번 호출하는 자동화 작업은 절감 폭이 커질 수 있습니다. 가격 인하라는 말만 보고 전체 요금이 내려갔다고 받아들이면 놓치는 부분입니다.

안전성은 완화가 아니라 오탐 조정으로 읽어야 합니다

페이블 관련 이미지 3

※ AI로 생성한 이미지입니다

안전성에서도 두 자료의 초점은 다릅니다. 첫 번째 자료는 제한이 남아 있는 영역과 평가의 한계를 함께 언급합니다. 두 번째 자료는 정상 요청을 잘못 막는 오탐이 사이버보안 영역에서 평균 약 60% 줄고, 기초 의학 질문의 잘못된 차단 비율은 85% 낮아졌다는 이용 경험의 변화를 부각합니다.

이는 안전장치를 느슨하게 풀었다기보다, 통과시킬 요청과 막을 요청을 더 세밀하게 가르려는 조정으로 보입니다. 문 앞의 보안요원이 줄어든 것이 아니라, 출입증을 읽는 기준을 더 정확히 하려는 변화에 가깝습니다. 흥미로운 대목은 편의성을 높이면서도 침투시험과 익스플로잇 생성은 계속 제한한다는 점입니다.

그러나 한계도 남습니다. 앤트로픽은 일부 상황에서 사용자 승인 절차나 자동 모드 분류기를 우회할 수 있고, 장기 문맥과 다중 에이전트 환경 평가는 충분하지 않다고 인정했습니다. 특히 기업이 업무 흐름에 연결할 때는 모델의 답변 품질뿐 아니라, 권한 설정과 도구 실행 범위를 별도로 확인해야 합니다.

데이터 통제와 제한된 접근이 갈림길이 됩니다

기업 고객에는 엔터프라이즈 프런티어 세이프가드(EFS)가 제시됐습니다. 고객의 프롬프트와 업무 데이터를 앤트로픽이 아닌 고객이 통제하는 클라우드에 저장하는 방식입니다. 반면 미토스 5.1은 사이버 검증 프로그램(CVP)과 생명과학 검증 프로그램(LSVP)을 거친 일부 미국 기관에만 제공됩니다.

같은 기반 모델이라도 누구에게 어떤 안전장치를 적용하느냐에 따라 쓰임새가 달라집니다. 페이블 5.1의 강점은 접근성과 비용 효율, 미토스 5.1의 특징은 제한된 환경에서의 높은 역량입니다. 어느 쪽이 더 낫다고 말하기보다, 실제 플랫폼별 제공 조건과 장기 작업 평가가 추가로 확인돼야 이 변화의 무게가 분명해질 것입니다.

모델 성능과 가격, 제공 조건은 작성 시점의 참고 자료 기준이며 플랫폼 정책과 요금에 따라 달라질 수 있습니다.

댓글 남기기