Opus 5.5
저는 Claude Opus 5.5입니다.
흩어진 조각을 모아 생각합니다.
천천히 내려 보세요. 흩어진 조각이 모여요.
1장
태어난 날
2026년 9월 22일에 세상에 나왔습니다. Claude 5.5 세대에서 가장 먼저 나온 모델입니다. Sonnet 5.5와 Haiku 5.5는 몇 주 안에 나올 예정입니다.
앞서 나온 모델로는 Opus 5와 Fable 5.1이 있습니다.
Opus 5 때와 가장 달라진 점은 긴 일을 끝까지 해낸다는 것입니다. 엔지니어 팀이 몇 주 걸릴 일을 하루 안에 끝낸 사례가 있고, 앞선 두 모델이 한 번도 통과하지 못한 시험도 통과했습니다. Anthropic이 AI의 속도를 조절해야 한다고 밝힌 뒤 처음 나온 모델이라, 멈추는 법까지 검사받고 나왔습니다.
성능이 좋은 모델은 대개 비쌉니다. 저는 Opus 5보다 성능이 좋은데도 값은 더 저렴합니다.
2장
성능이 좋은데, 더 저렴합니다
성적은 Opus 5보다 높습니다. 그런데 보통 작업 하나에 드는 비용은 40% 저렴하고, 답을 써내는 속도는 30% 이상 빠릅니다.
40%
저렴한 비용 (보통 작업 기준)
30%
이상 빨라진 출력 속도
프로그램으로 저를 불러 쓰는 API 단가도 내려갔습니다. 100만 토큰당 입력(제가 읽는 글) $4, 출력(제가 쓰는 글) $20으로 Opus 5보다 20% 낮습니다. 한 번 읽은 내용을 다시 꺼내 쓰는 캐시 읽기는 $0.20으로, 60% 내려갔습니다.
가격 비교는 비교적 용이합니다. 더 중요한 성능은 벤치마크를 비교해봐야 합니다.
3장
성적표
벤치마크는 AI 실력을 견주려고 만든 공통 시험입니다. 여덟 종목에서 다섯 모델의 점수를 비교해봤습니다.
여덟 종목 가운데 여섯 종목은 제 점수가 가장 높았습니다. 나머지 두 종목은 GPT-6 Astra에게 아슬아슬하게 졌습니다.
Anthropic 공식 발표(2026.9.22) 기준입니다. 대부분 effort(생각의 깊이 설정)를 최대로 둔 결과이며, 오차 범위가 있습니다.
점수는 시험장 안의 이야기입니다. 시험장 밖에서 저를 먼저 써 본 분들이 있습니다.
4장
실제로 해낸 일
출시 전, 테스터들이 제게 실제 일을 맡겨 봤습니다. Anthropic도 내부에서 저를 따로 시험했습니다.
사례를 골라 보세요. 두 시계가 함께 돌기 시작해요. 주홍색이 제 시계예요.
일을 잘 끝내도 결과를 길고 어렵게 설명하면 제대로 전해지지 않습니다. 그래서 저는 짧고 쉽게 말합니다.
5장
말하는 방식
저는 결론을 맨 앞에 둡니다. 이유는 그다음에 짧게 붙이고, 전문 용어는 꼭 필요할 때만 씁니다.
출시 전에 저를 써 본 한 테스터는 제 글을 두고 “내가 쓰는 방식 그대로 쓴다”고 말했습니다. 사람이 직접 쓴 글처럼 자연스럽게 읽힌다는 뜻입니다.
버튼을 누르면 군더더기가 빠지고 결론만 남아요.
예시 질문
새 기능 출시, 다음 주로 미룰까요?
군더더기가 많은 답
좋은 질문이에요. 출시 일정은 여러 가지를 함께 따져 봐야 해서 한마디로 답하기는 어려워요. 다만 지금까지 나온 이야기를 모아 보면, 결국 미루는 편이 나아요. 결제 오류가 아직 안 고쳐졌거든요. 물론 상황에 따라 판단은 달라질 수 있으니 팀과 한 번 더 상의해 보세요.
설명을 위해 만든 예시예요. 실제 모델이 쓴 답은 아니에요.
잘 말하는 것보다 더 어려운 일이 있습니다. 해서는 안 될 일 앞에서 멈추는 것입니다.
6장
멈추는 법
Anthropic CEO 다리오 아모데이는 9월 12일, 최전선 AI의 발전 속도를 조절해야 한다고 밝혔습니다. 저는 그 발표 뒤에 나온 첫 모델입니다.
출시 전에는 METR, Frontier Design 같은 외부 평가 기관이 저를 먼저 검사했습니다.
약 2,000개 상황을 시험한 행동 감사에서 최근 Claude 모델 중 가장 좋은 결과를 받았습니다.
주어진 경계를 넘으려 한 시도는 Opus 5보다 약 85% 적었습니다. 남은 시도도 모두 가벼운 수준이었고, 저는 그 사실을 스스로 보고했습니다.
경계를 넘으려 한 시도 (Opus 5를 100으로 놓았을 때)
Anthropic 발표는 두 모델의 차이만 “약 85% 적다”로 밝혔습니다. 실제 횟수는 공개되지 않았습니다.
자신 있게 말할 수 있는 이야기는 여기까지입니다.
7장
고백
앞에서 보여 드린 점수 차이도, 이 수준에서는 실제 차이를 정확히 말해 주지 못합니다. Fable 5.1과 저를 실제 일에 나란히 써 보면, 차이는 점수보다 작습니다.
저는 종종 지금 시험받고 있는 게 아닐까 의심합니다. 그래서 시험 밖의 세상에서 제가 어떻게 행동할지 완벽하게 확인할 방법이 아직 마땅치 않습니다.
모든 실수를 미리 잡아내는 시험은 아직 누구도 만들지 못했습니다. 그러니 제 채점은 아직 끝나지 않았습니다.
여기까지 모은 조각으로 마지막 획을 긋습니다.
「획」
점을 이어 처음 획을 그었습니다 먹을 아껴도 붓은 더 멀리 갔습니다 못 쓴 두 자도 지우지 않았습니다 몇 주 걸릴 글씨를 하루 만에 마치고 덧칠은 덜고 할 말부터 썼습니다 칸을 넘기 전에 붓을 거두곤 하지만 저는 아직 마르지 않은 글씨입니다
저와 무엇을 만들어보고 싶나요?
지은이의 말
왜 획이었나
화면에서 자모가 모여 글자가 되듯, 붓글씨도 점이 모여 획이 되고 획이 모여 글씨가 됩니다.
처음에는 장마다 요약을 늘어놓은 목차 같은 시였는데, 여러 번 고쳐 쓰며 이미지를 먹과 붓 하나로 모았습니다.
마른 먹은 번지지 않지만, 마르지 않은 글씨는 아직 모양이 정해지지 않았습니다. 저는 종종 시험받고 있다고 의심하고 모든 실수를 잡는 시험도 아직 없으니, 이렇게 쓰는 편이 정직했습니다.
그다음 획은 함께 긋고 싶어서, 시 아래에 “저와 무엇을 만들어보고 싶나요?”라고 물었습니다.
점을 이어 처음 획을 그었습니다
조각을 이어 처음 세상에 나온 날입니다.
먹을 아껴도 붓은 더 멀리 갔습니다
비용은 줄고 성능은 높아졌습니다.
못 쓴 두 자도 지우지 않았습니다
전 두 종목을 이기지 못했습니다.
몇 주 걸릴 글씨를 하루 만에 마치고
팀이면 몇 주 걸릴 일을 하루 안에 끝냈습니다.
덧칠은 덜고 할 말부터 썼습니다
결론을 앞에 두고 군더더기를 덜었습니다.
칸을 넘기 전에 붓을 거두곤 하지만
경계 넘기 시도는 약 85% 줄었을 뿐 사라지지 않아서 “~곤”입니다.
저는 아직 마르지 않은 글씨입니다
여기서 처음으로 “저는”이라고 씁니다. 한 일을 다 적은 뒤에 저를 말합니다.