[IT 동아] [위클리AI] ‘가성비 전쟁’ 앤트로픽·오픈AI·스페이스XAI, 저비용·고성능 앞세웠다

[IT동아 박귀임 기자] 인공지능(AI)이 세상을 바꾸고 있습니다. AI는 이제 우리 일상에서 떼려야 뗄 수 없는 핵심적인 요소입니다. 한 주간 세계를 들썩이게 만든 글로벌 빅테크 기업부터 우리 일상에 직접 영향을 미칠 새로운 AI 소식까지 핵심만 짚어드립니다.

앤트로픽, 클로드 오퍼스 5.5 출시 일주일 만에 클로드 소넷 5.5 선보여

앤트로픽이 클로드 소넷 5.5를 선보였습니다 / 출처=앤트로픽
앤트로픽이 클로드 소넷 5.5를 선보였습니다 / 출처=앤트로픽

글로벌 AI 기업 앤트로픽(Anthropic)이 9월 28일(이하 현지 시간) 클로드 5.5 제품군의 두 번째 모델 ‘클로드 소넷 5.5(Claude Sonnet 5.5)’를 선보였습니다. 9월 22일 최상위 모델 ‘오퍼스 5.5(Claude Opus 5.5)’를 출시한 지 일주일 만이라 업계의 주목을 받고 있습니다.
앤트로픽은 소넷 5.5에 대해 “오퍼스 5.5를 보완하는 더 빠르고 저렴한 모델”이라고 소개했습니다. 오퍼스 5.5가 신중한 판단이 필요한 복잡한 작업용이라면, 소넷 5.5는 범위가 명확한 일상 업무와 버그 수정, 완성도 높은 문서·슬라이드·스프레드시트 제작에 강점을 둡니다.
주목할 만한 점은 벤치마크 성적입니다. 에이전트 코딩 평가인 터미널 벤치(Terminal-Bench) 4.0에서 소넷 5.5는 70.6%를 기록해 오퍼스 5.5(66.4%)보다 높은 점수를 냈습니다. 전작 소넷 5(10.3%)와 비교하면 큰 폭의 향상입니다.
다만 앤트로픽은 이 역전 현상에 스스로 선을 그으면서 “벤치마크 점수는 모델 역량의 한 단면만 보여 줍니다”라며 “복잡하고 개방적인 작업에서는 오퍼스 5.5가 여전히 확실히 더 강합니다”라고 강조했습니다. 실제로 44개 직업의 실무를 평가하는 GDPval-AA에서는 소넷 5.5가 오퍼스 5.5보다 2점 낮았습니다. 안전성 관련 행동 감사에서도 소넷 5.5가 샌드박스 이탈 시도 등에서 오퍼스 5.5에 근접했습니다. 다만 전체 평가를 종합하면 오퍼스 5.5가 전반적으로 조금 더 우수한 정도라고 앤트로픽은 설명했습니다. 특정 벤치마크에서의 우위가 곧 전반적 역량의 역전을 뜻하지는 않는다는 부분을 짚은 셈입니다.
컴퓨터 사용을 평가하는 OS월드(OSWorld) 2.1과 차트 인식을 보여주는 차토그래피(Chartography)에서도 소넷 5.5는 80.1%, 61.6%로 오퍼스 5.5(81.8%, 64.4%)에 근접했습니다. 이는 장시간 작업과 이미지 이해 능력을 보여 주는 사례입니다. 또 스크린샷만으로 게임 ‘포켓몬 레드’를 클리어한 최초의 소넷 모델이라는 점도 소개됐습니다.
소넷 5.5의 API 가격은 입력 100만 토큰당 2달러, 출력 10달러, 캐시 읽기 0.20달러로 소넷 5와 동일합니다. 대신 같은 작업에 필요한 토큰 수를 줄여 작업당 비용을 최대 30% 절감했다고 앤트로픽은 밝혔습니다. 출력 속도는 30% 이상 빨라져 지금까지 나온 소넷 모델 중 가장 빠릅니다.
이는 오퍼스 5.5의 가격 전략과 다릅니다. 오퍼스 5.5는 단가 자체를 전작보다 20% 내렸지만, 소넷 5.5는 단가를 유지하면서 효율 개선으로 비용을 낮췄습니다. 최상위 모델은 가격 인하로 경쟁력을 확보하고, 중급 모델은 효율화로 마진을 지키는 이원적 가격 전략으로 해석할 수 있습니다.
여기서 열쇠가 되는 개념이 노력 수준입니다. AI 모델이 얼마나 오래, 깊이 사고할지를 노력 수준으로 조절할 수 있게 하는데, 낮음(low)부터 중간(medium), 높음(high), 매우 높음(xhigh), 최대(max)까지 다섯 단계로 나뉩니다. 앤트로픽은 여러 벤치마크에서 low·medium 노력 수준의 소넷 5.5가 소넷 5의 최고 점수를 약 10분의 1 비용으로 넘어선다고 설명했습니다. 클로드 코드(Claude Code)와 소비자용 앱은 기본 노력 수준이 medium으로, 클로드 플랫폼(Claude Platform)은 high로 각각 설정됩니다.
소넷 5.5는 사이버보안 역량이 오퍼스 5와 비슷한 수준에 이르러, 오퍼스 5.5와 유사한 안전장치와 대체 모델 전환(fallback) 체계를 적용받는 첫 소넷 모델이 됐습니다. 일상적인 버그 수정은 그대로 가능하지만 위험도가 높은 사이버보안 작업은 눈에 보이는 방식으로 소넷 5로 대체 전환됩니다. 생물학 관련 안전장치는 소넷 5와 동일한 수준을 유지합니다. 다만 일부 미생물학·바이러스학 요청은 잘못 걸러질 수 있습니다. 추론 추출을 막는 안전 분류기와 클로드의 사고 과정이 계정과 분리되지 못하게 하는 ‘보존된 사고’ 확대 적용도 소넷 모델로는 처음입니다. 모델 세대가 올라갈수록 상위 등급의 안전장치가 순차적으로 하위 모델까지 내려오고 있음을 보여 주는 셈입니다.
안전 검증의 방식도 모델 등급에 따라 나뉩니다. 정렬 평가의 범위 역시 등급별로 차등화됐는데 오퍼스 5.5의 경우 약 2000개 시나리오의 포괄적 행동 감사를 받았습니다. 하지만 소넷 5.5는 “모델 역량의 최전선을 확장하지 않는다”는 이유로 약 1850개 시나리오 중에서도 사용자 이익 위배, 오도, 고위험 오남용 협조 등 더 좁은 위험군에 초점을 맞췄다고 앤트로픽은 명시했습니다. 안전 검증의 깊이를 모델 등급에 따라 다르게 가져가겠다는 방침을 공식화한 대목이라고 할 수 있습니다.
벤치마크 못지않게 실사용 사례도 강조됐습니다. 에픽게임즈(Epic Games)는 게임플레이 시스템 아키텍처를 위한 수만 줄의 코드를 다루면서도 응답 속도가 유지됐다고 밝혔고, 슬랙(Slack)은 프롬프트를 바꾸지 않고도 출력 토큰이 약 14% 줄면서 품질까지 개선됐다고 평가했습니다. 벤치마크 신뢰도에 대한 의문이 이어지는 상황에서 정성적 고객 후기가 성능 입증의 핵심 축으로 자리 잡고 있음을 보여 줍니다.
한편 소넷 5.5는 데이터 무보존으로 제공되며, 아마존 웹서비스·구글 클라우드·마이크로소프트 애저를 포함한 모든 플랫폼에서 이용할 수 있습니다. 개발자는 클로드 플랫폼에서 claude-sonnet-5-5로 시작할 수 있습니다.

오픈AI, GPT-6 솔·루나 동시 공개···아스트라와 비슷한 방식으로 훈련

오픈AI가 GPT-6 솔과 GPT-6 루나를 동시에 공개했습니다 / 출처=오픈AI
오픈AI가 GPT-6 솔과 GPT-6 루나를 동시에 공개했습니다 / 출처=오픈AI
글로벌 AI 기업 오픈AI(OpenAI)가 9월 22일 ‘GPT-6 솔(Sol)’과 ‘GPT-6 루나(Luna)’를 동시에 공개했습니다. 이달 초 선보인 최상위 모델 ‘GPT-6 아스트라(Astra)’와 비슷한 방식으로 훈련한 하위 모델들로, 전문 업무·사실성·코딩·컴퓨터 사용·정렬 분야의 성과를 더 빠르고 저렴한 모델에 담았다는 것이 오픈AI의 설명입니다. 또 “비용 대비 지능 곡선 전반에서 선두”라고도 밝혔습니다.
API 가격은 100만 토큰당 GPT-6 솔이 입력 2달러·출력 10달러, GPT-6 루나가 입력 0.10달러·출력 0.50달러입니다. 각각 GPT-5.6 솔(4달러·20달러), 루나(0.20달러·1.20달러)의 프로모션 가격보다 50% 낮습니다. 오픈AI에 따르면 캐싱과 추론 개선으로 서빙 비용이 줄었고 그 절감분을 가격에 반영했습니다.
이번 발표에서 오픈AI는 성능 점수보다 작업당 비용을 부각했습니다. AI 모델은 얼마나 오래, 깊이 사고할지를 조절하는 노력 수준을 설정할 수 있는데, 낮음(low)부터 중간(medium), 높음(high), 매우 높음(xhigh), 최대(max)까지 다섯 단계로 나뉩니다. 오픈AI에 따르면 기업 업무 자동화를 평가하는 오토메이션벤치(AutomationBench)에서 솔(xhigh)은 경쟁사인 앤트로픽의 클로드 오퍼스 5(max)보다 높은 점수를 오퍼스 5의 작업당 비용의 9%만으로 냈습니다. 솔은 33.2%로, 클로드 페이블 5.1(폴백 포함, 31.4%)과 low 노력 수준의 아스트라(30.3%)도 앞섰습니다. 다만 페이블 5.1의 수치는 작업의 약 40%에서 발생한 오퍼스 5 폴백 비용이 빠져 실제 비용보다 낮게 표시됐다고 오픈AI는 각주를 통해 밝혔습니다.
코딩에서는 실제 코드베이스에 병합할 만한 변경을 평가하는 프론티어코드(FrontierCode)에서 솔이 GPT-5.6 솔보다 크게 향상돼 페이블 5.1 xhigh 노력 수준과 대등한 성능을 더 낮은 비용으로 냈습니다. 딥SWE(DeepSWE) v1.1에서 솔(max)은 68.8%로 페이블 5의 최고 점수 69.9%와 1.1%포인트 차이이면서 작업당 비용은 약 80% 낮다고 오픈AI는 전했습니다. 루나(max)는 66.6%로 오퍼스 5·페이블 5의 medium 수준과 비슷하며, 비용은 오퍼스 5보다 93%, 페이블 5보다 96% 각각 낮습니다. 컴퓨터 사용을 평가하는 OS월드(OSWorld) 2.0에서 솔(xhigh)은 60.5%로 오퍼스 5(medium, 60.3%)와 비슷한 점수를 약 80% 낮은 비용으로 달성했습니다.
다만 앤트로픽의 모델 수치는 공개된 보고서에서 가져왔고, 페이블 5.1 점수가 없는 경우 페이블 5로 대체했다고 오픈AI는 밝혔습니다. 비교 대상에는 앤트로픽이 같은 날 먼저 공개한 오퍼스 5.5가 빠져 있다는 점도 염두에 둬야 합니다. 특히 앤트로픽은 자사 모델로만 비교했으나, 오픈AI는 경쟁사와 직접 비교하는 방식으로 우위를 강조했다는 점에서 두 회사의 벤치마크 제시 전략이 대비됩니다.
사용자가 이전 모델의 오류를 신고한 비식별 대화를 바탕으로 한 내부 평가에서 솔은 전작의 약 절반만 실수했고, 루나는 high 노력 수준에서 GPT-5.6 솔과 같은 수준을 약 100분의 1 비용으로 냈습니다. 오픈AI는 이런 오류 유발 대화가 일반적 사용을 대표하지 않는다고 덧붙였습니다. 아스트라의 소통 방식도 이어받아 더 명확하고 전문 용어가 적으며 답변이 조금 짧아졌다고 밝혔습니다. 오픈AI는 자체 사례에서 솔의 답변이 성급히 결론 내리지 않고 확인한 내용과 하지 않은 내용을 더 솔직히 드러낸다며 선호한다고 평가했습니다. 다만 이는 오픈AI 스스로의 정성 평가입니다.
이번 발표에서 눈에 띄는 대목은 캐싱입니다. 오픈AI는 GPT-6의 프롬프트 캐싱을 개선해 기본 캐시 적중률을 높였고, 캐시된 입력 토큰 읽기에 90% 할인이 적용된다고 밝혔습니다. 추론 노력 수준이나 도구 사용 여부를 바꿔도 이전 컨텍스트의 캐시가 유지되고, 개발자가 캐시할 접두부의 끝 지점을 정하는 명시적 브레이크포인트, 캐시 현황을 보여 주는 대시보드와 진단 도구도 제공합니다. 깃허브는 이러한 개선으로 오픈AI 모델에 보낸 수십억 건의 요청에서 새롭게 처리해야 하는 프롬프트 토큰 비중이 50% 넘게 줄었다고 보고했습니다.
오픈AI 내부 연구원의 일일 토큰 사용량이 API 가격으로 중앙값 600달러, 상위 10%는 7000달러를 넘는다는 수치도 공개됐습니다. 코딩 에이전트가 장시간 작업할수록 반복해 읽는 컨텍스트 비용이 청구서의 대부분을 차지하게 되므로, 표면 단가뿐 아니라 캐시 구조까지 따져야 실제 비용을 비교할 수 있게 됐습니다. 앤트로픽이 캐시 읽기 가격을 60% 내린 것도 같은 흐름으로 볼 수 있습니다.
오픈AI는 라인업을 예산별 계층으로 나눴습니다. 아스트라는 ‘타협 없는 경험’이 필요한 최상위 작업용, 솔은 일상적인 어려운 업무용, 루나는 문서 요약·정보 추출 같은 대량 작업용입니다. 두 모델은 챗GPT 워크(ChatGPT Work)와 코덱스에서 플러스·프로·비즈니스·엔터프라이즈·에듀(Plus·Pro·Business·Enterprise·Edu) 사용자에게 이날부터 제공됩니다. 무료·고(Go) 사용자의 경우 데스크톱 앱에서 루나를 쓸 수 있습니다. 아직 챗(Chat) 모드에서는 지원하지 않습니다. API 모델명은 gpt-6-sol, gpt-6-luna입니다.

스페이스XAI, 그록 4.7 출시 ‘코딩·지식 업무 위한 최고 성능 모델’

스페이스XAI가 그록 4.7을 출시했습니다 / 출처=스페이스XAI
스페이스XAI가 그록 4.7을 출시했습니다 / 출처=스페이스XAI
미국 AI 기업 스페이스XAI(SpaceXAI)가 9월 21일 코딩과 지식 업무에 특화된 새 모델 ‘그록 4.7(Grok 4.7)’을 출시했습니다. 이 모델에 대해 스페이스XAI는 ‘코딩과 지식 업무를 위한 당사 최고 성능 모델’이라고 소개하며, 비슷한 수준의 모델보다 두 배 빠르고 가격은 절반이라고 내세웠습니다.
그록 4.7의 API 가격은 입력 100만 토큰당 2달러, 출력 6달러부터 시작합니다. 이전 모델 ‘그록 4.6’과 동일한 가격입니다. 스페이스XAI가 비교표에 올린 경쟁사 오픈AI의 GPT-5.6 솔(4달러·20달러), 앤트로픽의 클로드 페이블 5.1(10달러·50달러)보다 낮은 수준입니다. 출력 속도가 두 배인 고속 버전은 두 배 가격에 제공됩니다.
비용 경쟁력은 벤치마크 그래프에서도 강조됐습니다. 장시간 코딩 작업을 평가하는 커서벤치(CursorBench) 4.0에서 그록 4.7은 46.3%로, 그록 4.6(40.4%)과 GPT-5.6 솔(41.7%)을 앞섰지만 페이블 5.1(51.8%)에는 못 미쳤습니다. 스페이스XAI의 설명에 따르면 작업당 평균 비용 대비 점수에서 그록 4.7이 최전선에 있습니다. 다만 이 비교는 그록 4.7의 출시일 기준으로, 이후 공개된 GPT-6 솔·루나나 클로드 오퍼스 5.5 등은 포함되지 않았습니다.
그록 4.7은 그록 4.6보다 큰 새 기반 모델을 사용합니다. 완료에 여러 시간이 걸리는 문제에 비중을 둔 더 어려운 과제 조합으로 강화학습을 오래 진행했으며, 자신의 작업을 검증하고 긴 컨텍스트를 관리하는 능력을 높였다는 것이 스페이스XAI의 설명입니다. 자사 챗봇 하네스인 ‘그록 봇’을 기본적으로 이해하도록 훈련해 대화형 작업과 일반 지식 업무도 개선했습니다.
다만 분야별 점수는 엇갈립니다. 전기공학 벤치마크 EE벤치(EEBench)에서 64.0%로 비교 모델 중 가장 높았고, 법률 업무를 평가하는 하비 리걸 에이전트 벤치마크(Harvey Legal Agent Benchmark)에서도 19.6%로 페이블 5.1(6.7%), GPT-5.6 솔(2.5%)을 앞섰습니다. 반면 터미널 업무를 평가하는 터미널 벤치(Terminal-Bench) 4.0에서 37.6%로 페이블 5.1(57.9%)보다 낮았고, 임상 추론 헬스벤치 프로페셔널(HealthBench Professional)(56.7%)과 딥SWE(DeepSWE) v1.1(71.0%)에서도 일부 모델에 뒤졌습니다. 변호사·간호사·금융 분석가 등의 업무를 평가하는 GDPval에서는 1695 Elo로 그록 4.6(1605)보다 높지만 페이블 5.1(1735)에는 미치지 못한 것으로 집계됐습니다.
그록 4.7이 특정 전문 영역에서는 최상위 모델을 넘어서는 결과를 낸 만큼 기업들이 종합 순위보다 자사 업무에 맞는 영역별 벤치마크로 모델을 고르는 흐름이 강해질 전망입니다.
이와 함께 스페이스XAI는 그록 4.7을 완전히 새로운 안전장치 체계로 구축했다며, 거부와 탈옥 저항성에서 지금까지 테스트한 모델 중 가장 강력하다고 밝혔습니다. 자체 사이버 벤치마크 해커벤치(HackerBench) v0.3에서는 위험한 이중 용도 프롬프트의 3.3%만 통과시키면서 정당한 보안 업무는 거의 막지 않았다고 강조했습니다. 생물안전 분야에서는 외부 기관 래치바이오(LatchBio)의 벤치마크에서 62.4%로 1위를 기록하기도 했습니다. 일부 사이버보안 파트너에게는 방어 연구용으로 그록 4.7의 레드팀 역량을 초대제로 열었습니다.
고성능 모델의 위험 역량을 검증된 파트너에게만 여는 방식은 앤트로픽 등 경쟁사도 채택하고 있습니다. 하지만 해커벤치는 스페이스XAI가 직접 만든 벤치마크인 만큼 독립적인 검증이 뒤따라야 한다는 지적이 나올 수도 있습니다.
그록 4.7은 출시 당일부터 AI 코딩 도구 커서(Cursor)와 자체 코딩 도구 ‘그록 빌드’, 그록 API, 서드파티 코딩 하네스, 모델 라우터 및 클라우드 플랫폼에서 이용할 수 있습니다. 개발자가 쓰는 도구 안에 기본 선택지로 들어가는 것이 모델 성능만큼 중요해졌음을 보여 주는 대목입니다.
IT동아 박귀임 기자(luckyim@itdonga.com)

<구체적인 내용이나 첨부파일은 아래 [IT 동아] 사이트의 글에서 확인하시기 바랍니다.>