2026년 7월 28일 화요일

중국산 AI의 역습 (2026) | DeepSeek·Qwen·Kimi·GLM 어디까지 왔나

 

도입부 — DeepSeek 충격, 그 후 1년

2025년 초 DeepSeek이 "훨씬 싼 비용으로 프론티어급 성능"을 보여주며 시장을 흔들었을 때만 해도, 많은 사람이 "일회성 이벤트"로 봤습니다. 그런데 1년이 지난 2026년, 상황은 훨씬 커졌습니다. 이제 중국 AI는 하나의 회사가 아니라 여러 회사가, 그리고 **"따라잡기"가 아니라 특정 영역에서 "주도"**하는 국면으로 넘어갔습니다.

물론 과장은 금물입니다. 가장 어려운 최상위 작업은 여전히 서구 프론티어 모델이 앞섭니다. 하지만 오픈웨이트, 가격, 그리고 칩 독립이라는 세 전선에서 벌어지는 변화는 실무자가 무시할 수 없는 수준입니다. 오늘은 감정이나 진영 논리 없이, 지금 실제로 무슨 일이 벌어지고 있는지이걸 어떻게 활용할지를 정리하겠습니다.


본론 1 — '역습'의 3대 축

① 오픈웨이트 지배 가장 상징적인 변화입니다. 한때 오픈소스 AI는 Meta의 Llama가 상징이었지만, 2026년 오픈웨이트 프론티어는 Zhipu·DeepSeek·Moonshot·Alibaba·MiniMax 등 중국 랩들이 지배하고 있습니다. 서구는 Llama 5와 Gemma 4로 깃발을 지키는 형국입니다. 2026년 7월 공개된 Moonshot의 **Kimi K3(2.8조 파라미터)**는 "세계 최대 오픈소스 모델"로 홍보되며 이 흐름을 상징합니다. (단, 독립 벤치마크 검증은 아직입니다.)

② 가격 파괴 중국 모델은 API 가격을 서구 대비 5~30배 저렴하게 책정합니다. DeepSeek의 저가 모델이 100만 토큰당 $0.28인 반면 서구 최상위는 $10 안팎으로, 약 35배 차이가 납니다. MiniMax는 $0.10/$0.30로 시장 가격의 새 바닥을 그었습니다. 이건 단순 할인이 아니라 글로벌 비용 기준 자체를 리셋하는 사건입니다.

③ 칩 독립과 속도 수출 통제로 최신 Nvidia 칩 확보가 어려워지자, 중국 랩들은 **효율(MoE 구조)**과 국산 칩으로 대응했습니다. Zhipu는 프론티어 모델을 Nvidia 없이 Huawei Ascend 칩만으로 학습한 첫 사례를 만들었습니다. 또한 대기업 사내팀보다 집중형 독립 랩(DeepSeek·Moonshot·Zhipu·MiniMax)이 더 빠르게 프론티어에 도달하고 있습니다.

🖊️ 에디터 팁 — "싸다"는 표면일 뿐입니다. 진짜 이야기는 오픈웨이트(내 서버에서 돌릴 수 있음) + 초저가 + 칩 독립이 겹치면서, 특정 작업에서 "서구 구독을 꼭 써야 할 이유"가 줄어들고 있다는 점입니다.


본론 2 — 주요 플레이어 최신 정리

랩 (모델)강점대표 최신 모델오픈웨이트
DeepSeek코딩·추론·극저가V4-Pro (1.6T/49B, 1M 컨텍스트)
Alibaba Qwen다국어·멀티모달·크기 다양Qwen 3.6 Max/Plus (9B~397B)○(다수)
Moonshot Kimi롱컨텍스트·코딩·에이전트Kimi K3 (2.8T)
Zhipu GLM (Z.AI)에이전트·툴콜·구조화 출력GLM-5.2 (1M 컨텍스트)
MiniMax롱컨텍스트·창작·초저가M2.7 (Apache 2.0)
ByteDance Doubao유통·네이티브 영상 추론Doubao-Seed-2.0-Pro일부

몇 가지 눈에 띄는 지표: DeepSeek V4-Pro는 SWE-Bench Verified 80.6, LiveCodeBench 93.5, GPQA Diamond 90.1로 코딩·추론에서 강력합니다. Kimi는 최대 100개 병렬 서브에이전트로 에이전트 작업을 선도하고, Arena 프론트엔드 코딩에서 정상을 찍었습니다. GLM은 툴 사용 안정성으로 자동화에, Qwen은 9B~397B의 넓은 크기와 다국어로 셀프호스팅에 강합니다. MiniMax는 "작지만 강한" 노선으로 AIME 등 일부 지표에서 더 큰 모델을 앞섭니다.


본론 3 — 그래서 서구 프론티어와 격차는?

여기서 균형을 잡아야 합니다. "중국이 이겼다"도, "아직 멀었다"도 정확한 문장이 아닙니다.

  • 중상위 구간: 중국 모델은 대부분의 표준 벤치마크에서 중상위 서구 모델과 대등하거나 앞섭니다. 특히 코딩·에이전트 특정 벤치마크에서는 서구 최상위 모델을 넘긴 사례도 있습니다.
  • 절대 프론티어: 가장 어려운 작업의 최정상은 **여전히 클로즈드 서구 모델(Claude·GPT·Gemini 계열)**이 쥐고 있습니다.
  • 핵심: 그 격차가 좁고, 작업에 따라 뒤집힌다는 것. "무조건 서구"도 "무조건 중국"도 아니고, 작업별로 최적 모델이 다른 시대가 됐습니다.

본론 4 — 실무자를 위한 활용 가이드 (즉시 실행)

접근 방법은 셋입니다. ① 각 랩의 공식 앱/API, ② 여러 모델을 한 키로 라우팅하는 API 게이트웨이(OpenRouter 등), ③ 오픈웨이트를 자체 서버에 셀프호스팅. 작업별 추천:

① 저비용 대량 처리 (분류·요약·태깅)

선택: MiniMax·Qwen 저가 모델을 API 게이트웨이로. 결과: 서구 대비 수십 분의 1 비용으로 대량 작업 처리.

② 코딩·디버깅·복잡한 로직

선택: DeepSeek V4-Pro. 결과: 코딩 벤치마크 최상위권 성능을 저가로.

③ 장문 문서·RAG 파이프라인

선택: Kimi(롱컨텍스트). 결과: 대용량 PDF·CSV를 한 번에 처리.

④ 에이전트·툴 호출 자동화

선택: GLM-5.2. 결과: 함수 호출·구조화 출력이 안정적이라 다단계 자동화에 적합.

⑤ 다국어·멀티모달 작업

선택: Qwen. 결과: 넓은 언어 커버리지 + 이미지·오디오 처리.

⑥ 민감 데이터가 있는 경우

선택: 오픈웨이트를 자국·EU 클라우드에 셀프호스팅. 결과: 데이터가 외부(특히 해외 클라우드)로 나가지 않게 통제.

🖊️ 에디터 팁 — 굳이 하나만 고를 필요 없습니다. 작업별 라우팅이 정답입니다. API 게이트웨이를 쓰면 코딩은 DeepSeek, 자동화는 GLM, 대량은 MiniMax 식으로 한 키에서 갈아탈 수 있습니다.


본론 5 — 반드시 알아야 할 주의사항 3가지

  • 데이터 주권·컴플라이언스: 중국 클라우드의 공식 API로 쓰면, 규제 데이터·민감 정보의 처리 위치가 문제될 수 있습니다. 이 경우 오픈웨이트 셀프호스팅이 표준 완화책입니다.
  • 벤치마크 회의주의: "세계 최대", "최고 점수" 같은 제조사 자기 보고는 독립 검증 전까지 유보하세요. Kimi K3의 규모 주장도 아직 독립 벤치마크가 확인하지 않았습니다.
  • 콘텐츠 제한: 중국 모델은 현지 규정에 맞춘 콘텐츠 제한이 있어, 특정 주제에서는 응답이 제약될 수 있습니다. 용도에 따라 확인이 필요합니다.

마무리 — '진영'이 아니라 '작업'으로 고르세요

중국산 AI의 역습은 이념 문제가 아니라 실무 선택지의 확장입니다. 이제 같은 작업을 훨씬 싸게, 때로는 내 서버에서 처리할 길이 열렸습니다. 단, 데이터·검증·콘텐츠 제한이라는 조건표를 함께 봐야 합니다.

  1. 내가 자주 하는 AI 작업 3가지를 적고,
  2. 위 활용 가이드에서 각 작업에 맞는 중국 모델을 매칭한 뒤,
  3. 민감 데이터 여부로 "공식 API vs 셀프호스팅"을 정하세요.

👉 오늘의 실행 과제: API 게이트웨이(OpenRouter 등)에 가입해, 지금 쓰는 작업 하나를 중국 모델로 돌려 비용과 품질을 서구 모델과 직접 비교해보세요. 숫자로 보면 판단이 쉬워집니다.

⚠️ 모델·가격·벤치마크·라이선스는 매우 빠르게 바뀝니다. 이 글은 2026년 중반 공개 정보 기준이며, 도입 전 최신 사양과 라이선스·데이터 정책을 다시 확인하세요.


이 글은 특정 국가·기업 옹호나 비방이 아니라, 공개된 벤치마크·가격·릴리스 정보를 바탕으로 시장 동향을 실무 관점에서 정리한 것입니다.

2026년 7월 26일 일요일

ChatGPT 데스크톱 Work·Codex 모드와 Computer Use 완벽 정리

 

도입부 — "Codex 앱이 사라졌다?" 아니요, 합쳐졌습니다

Codex 앱을 쓰던 분이라면 최근 앱이 바뀐 걸 눈치채셨을 겁니다. 2026년 7월 9일, OpenAI가 독립형 Codex 앱을 새 ChatGPT 데스크톱 앱에 통합했기 때문입니다. 이제 하나의 데스크톱 앱 안에 Chat · Work · Codex 세 가지 모드가 들어 있고, 기존 앱은 'ChatGPT Classic'으로 이름이 바뀌었습니다.

이게 왜 중요할까요? 예전엔 "코딩은 Codex, 문서는 ChatGPT"처럼 앱을 오갔지만, 이제 하나의 창에서 대화 → 문서 작업 → 코딩 → 컴퓨터 조작까지 이어집니다. 게다가 세 모드 모두 무료 플랜 포함 전 플랜에서 제공됩니다. 오늘은 이 세 모드의 차이와 상세 기능, 그리고 화제의 Computer Use까지 실무 관점에서 정리하겠습니다.


본론 1 — 무엇이 바뀌었나 (2026년 7월 개편 요약)

  • 통합: 독립 Codex 앱 → 새 ChatGPT 데스크톱 앱으로 병합 (macOS + Windows, 전 세계).
  • 3모드 체제: 하나의 앱에 Chat, Work, Codex.
  • 구앱 = ChatGPT Classic: 계속 업데이트·보안 패치는 되지만, 일부 신규 에이전트 기능은 새 앱 전용입니다.
  • 전 플랜 제공: Chat·Work·Codex 모두 Free 포함 모든 플랜에서 사용 가능.
  • 기존 데이터 유지: Codex 채팅·프로젝트는 업데이트 후에도 남고, Codex 기록은 ChatGPT 기록과 분리 보관됩니다.

본론 2 — 세 모드, 무엇이 다른가

모드성격핵심 용도대상
Chat빠른 대화즉답, 검색, 일상 질문모두
Work장시간 에이전트문서·PPT·스프레드시트·Sites 등 완성 산출물기획자·마케터·직장인
Codex개발 전용 에이전트로컬 파일·레포·터미널 코딩개발자·기술직

① Work 모드 — 비개발자를 위한 '완성품' 에이전트 Work는 단순 답변이 아니라 검토 가능한 결과물을 만드는 에이전트입니다. GPT-5.6 기반으로,

  • 내 파일과 플러그인에서 맥락을 모으고,
  • 목표를 여러 단계로 쪼개 몇 시간씩 자율로 진행하며,
  • 그동안 진행 상황을 지켜보고, 질문에 답하고, 방향을 바꾸고, 중요한 동작은 승인받습니다.
  • 산출물: 문서, 프레젠테이션, 스프레드시트, Sites(웹페이지), 리포트 등.

즉 "리서치해서 보고서 PPT까지 만들어줘" 같은 끝까지 가는 작업에 맞습니다. 기술적 세부는 알아서 처리하고 결과만 보여주는 게 특징입니다.

② Codex 모드 — 개발자를 위한 '기술 디테일 노출' 에이전트 Codex는 소프트웨어 개발 전용입니다. 로컬 폴더·저장소·터미널·개발 도구와 직접 작동하며, 2026년 7월 신기능으로:

  • diff 내 인라인 편집: 변경분을 그 자리에서 수정.
  • 사이드패널 PR 리뷰: 풀 리퀘스트를 옆 패널에서 검토.
  • 멀티 레포 프로젝트: 한 프로젝트에 여러 저장소를 묶어 작업.
  • 더 빠른 Computer Use(GPT-5.6 기반).

Work가 기술 디테일을 감춘다면, Codex는 그 디테일을 그대로 보여줍니다. 참고로 Codex는 웹·모바일에서는 선택할 수 없고 데스크톱 전용이며, 모바일의 Remote 탭에서 진행 상황만 확인할 수 있습니다.

🖊️ 에디터 팁 — Work와 Codex는 플러그인을 공유합니다. 한 번 연결해둔 도구(내 파일·업무 앱)를 두 모드에서 함께 쓸 수 있습니다. 비개발자는 Work, 개발자는 Codex를 기본으로 두고 필요할 때 전환하세요.


본론 3 — Computer Use 상세 (화면을 직접 조작하는 AI)

Computer Use는 ChatGPT가 화면을 보고(see), 클릭하고(click), 입력하는(type) 기능입니다. 2026년의 핵심 확장은:

  • Windows 데스크톱 앱 조작 지원: 브라우저뿐 아니라 윈도우 데스크톱 애플리케이션까지 보고 클릭·입력합니다.
  • 실행 방법: @Computer로 호출. 시작 전 Computer Use 플러그인 설치가 필요합니다.
  • 동작 방식(Windows): 작업이 도는 동안 Codex가 활성 데스크톱의 전면을 점유합니다(사람이 직접 쓰듯 화면을 조작).
  • 속도: GPT-5.6 기반으로 이전보다 빨라졌습니다.
  • 권한: macOS에서는 화면·오디오 녹화 및 손쉬운 사용(Accessibility) 권한이 필요할 수 있습니다.
  • 원격(Remote): Windows 기기에서 작업을 시작하거나, 맥의 데스크톱 앱으로 돌려두고 모바일 Remote 탭에서 진행을 확인할 수 있습니다.

즉 "매주 특정 프로그램에서 리포트를 내보내는 반복 작업"처럼, API가 없는 데스크톱 앱까지 사람 대신 조작하는 자동화가 가능해진 셈입니다.

🖊️ 에디터 팁 — Computer Use는 강력한 만큼 권한을 많이 요구합니다. 민감한 화면·계정이 열려 있는 상태에서 돌리지 말고, 전용 환경이나 테스트 계정에서 먼저 검증하세요.


본론 4 — 모델과 요금 티어 (GPT-5.6 계열)

Work·Codex는 GPT-5.6 계열로 구동되며, 플랜에 따라 선택지가 다릅니다.

  • 모델 3종: GPT-5.6 Sol · Terra · Luna.
  • Free·Go: Terra 사용.
  • Plus·Pro·Business·Enterprise: Sol·Terra·Luna 중 선택 + effort(추론 강도) 설정 가능.
  • max effort: GPT-5.6 접근 사용자 모두 (설정에서 토글).
  • ultra effort: Work에서는 Pro·Enterprise, Codex에서는 Plus 이상.

추가로, ChatGPT Voice(GPT-Live 기반)로 Chat·Work·Codex에서 음성으로 작업을 지시·조율할 수 있고(자연스러운 끼어들기 지원), macOS에서는 '화면 컨텍스트'로 최상단 창을 공유할 수 있습니다.


본론 5 — 실전 사용 예시 6가지 (즉시 실행)

① Work: 데이터 → 보고서 PPT (비개발자)

지시: 이 CSV로 분기 매출 보고서를 PPT로 만들어줘. 핵심 인사이트 3개 포함. 결과: 검토 가능한 프레젠테이션 산출물. 수정 지시로 다듬기 가능.

② Work: 비교표 스프레드시트

지시: 견적서 3개를 항목별 비교 스프레드시트로 정리하고, 추천안을 표시해줘. 결과: 바로 공유 가능한 스프레드시트.

③ Work: 장시간 리서치 → Sites

지시: 경쟁사 5곳을 리서치해 요약 페이지(Sites)로 만들어줘. 중요한 판단은 나에게 승인받고 진행해. 결과: 몇 시간에 걸친 자율 작업 + 중간 승인 흐름.

④ Codex: 버그 수정 → PR

지시: 이 레포의 로그인 버그를 고치고 PR을 올려줘. 결과: 인라인 diff 수정 + 사이드패널 PR 리뷰로 검토.

⑤ Codex: 멀티 레포 기능 구현

지시: 프론트엔드·백엔드 두 레포에 걸친 알림 기능을 구현해줘. 결과: 한 프로젝트에서 여러 저장소를 동시에 다루는 작업.

⑥ Computer Use: 데스크톱 앱 자동화

지시: @Computer 이 프로그램에서 이번 주 리포트를 내보내 지정 폴더에 저장해줘. 결과: 화면을 직접 보고 클릭·입력해 반복 작업 대행(플러그인·권한 필요).


본론 6 — 도입 전 체크리스트

  • 권한·보안: Computer Use·로컬 폴더 접근은 강력한 만큼, 저장소 접근·명령 실행·검토 습관을 먼저 점검하세요.
  • Classic vs 새 앱: 일부 신규 에이전트 기능은 새 앱 전용입니다. Enterprise는 거버넌스·권한 설정이 유지되는지 확인.
  • 사용량: Work는 Codex와 동일한 사용량 구조를 따르며, 작업 종류에 따라 소모가 크게 달라집니다(공식 요금 페이지 확인).

마무리 — 내 작업에 맞는 모드부터 하나 정하세요

세 모드를 한꺼번에 익힐 필요는 없습니다. 내 일에 맞는 것 하나부터 시작하면 됩니다.

  1. 문서·기획·마케팅 → Work로 "완성 산출물" 하나 만들어보기.
  2. 코딩·기술 작업 → Codex로 버그 수정·PR 리뷰 돌려보기.
  3. 반복적인 데스크톱 작업 → Computer Use로 한 가지 루틴 자동화(권한·플러그인 먼저 설정).

👉 오늘의 실행 과제: 새 ChatGPT 데스크톱 앱을 설치(또는 업데이트)하고, 위 실전 예시 중 내 직무에 가장 가까운 것 하나를 그대로 따라 해보세요.

⚠️ ChatGPT 데스크톱 기능·모델·요금·플랜 구성은 매우 빠르게 바뀝니다. 이 글은 2026년 7월 개편 기준이며, 정확한 현재 사양은 OpenAI 공식 헬프센터(help.openai.com)에서 확인하세요.


이 글은 특정 제품 옹호가 아니라, 공개된 OpenAI 릴리스 노트·헬프센터 정보를 바탕으로 기능을 실무 관점에서 정리한 것입니다.

2026년 7월 24일 금요일

오픈클로(OpenClaw) 최신 업데이트 총정리 — v2026.6.33 신기능부터 창시자의 OpenAI 합류까지

 

도입부 — 공감 훅

"메신저로 톡 하나만 보냈는데 컴퓨터가 알아서 보고서를 써서 메일로 보냈다고?"

2025년 11월, 오스트리아 개발자 피터 스타인버거(Peter Steinberger)가 "그냥 재미삼아" 만든 개인 사이드 프로젝트가 지금 AI 에이전트 커뮤니티에서 가장 뜨거운 이름이 됐습니다. 바로 오픈클로(OpenClaw)입니다. 출근길 지하철에서 스마트폰으로 "어제 회의록 바탕으로 보고서 초안 써서 내 메일로 보내줘"라고 텔레그램 메시지만 보내면, 컴퓨터가 실제로 파일을 찾고 문서를 작성해서 메일까지 보내주는 방식으로 화제를 모았습니다.

문제는 이 도구가 몇 달 사이 이름도 세 번 바뀌고(Warelay → Clawdbot/Moltbot → OpenClaw), 창시자가 OpenAI에 합류하는 등 워낙 빠르게 변하다 보니 "지금 최신 상태가 정확히 뭔지" 따라가기 어렵다는 점입니다. 오늘은 오픈클로가 무엇인지부터, 2026년 7월 현재 최신 버전에서 뭐가 새로 생겼는지까지 한 번에 정리해드리겠습니다.

본론 — 오픈클로 최신 정보 및 실무 활용 가이드

오픈클로란 무엇인가

오픈클로는 메신저(텔레그램·슬랙·디스코드·왓츠앱 등)를 주된 인터페이스로 삼아, 사용자가 보낸 명령을 받아 여러 단계를 거쳐 실제 작업을 실행하는 오픈소스 자율 AI 에이전트입니다. MIT 라이선스로 공개되어 있고, 자체 LLM을 내장하지 않기 때문에 클로드나 챗GPT 같은 외부 모델 API를 연결하거나, 원한다면 로컬 LLM으로도 구동할 수 있습니다. 즉 오픈클로 자체는 '실행 엔진'이고, 두뇌 역할을 하는 AI 모델은 사용자가 원하는 대로 갈아 끼우는 구조입니다.

최근 반년의 타임라인 — 창시자의 OpenAI 합류까지

  • 2025년 11월 — 'Warelay'라는 이름으로 처음 공개
  • 2026년 1월 27일 — Anthropic으로부터 상표권 관련 문제 제기를 받아 'Moltbot'으로 개명
  • 2026년 1월 30일 — 발음이 입에 잘 붙지 않는다는 이유로 다시 'OpenClaw'로 최종 개명
  • 2026년 2월 15일 — 샘 올트먼이 직접 창시자 피터 스타인버거의 OpenAI 합류를 발표. 스타인버거는 '차세대 개인 에이전트' 개발을 이끌게 됐고, 오픈클로 자체는 재단 형태로 독립적인 오픈소스 프로젝트로 유지되며 OpenAI의 지원을 계속 받는 구조로 정리됐습니다.

한 사람의 사이드 프로젝트가 석 달 만에 대형 AI 기업의 관심을 끌 만큼 커진 셈인데, GitHub 스타 수도 2월 중순 18만 개에서 3월에는 28만 개를 돌파하며 빠르게 성장했습니다.

기능 진화 — '실험적 도구'에서 '에이전트 운영체제'로

2026년 3월 공개된 대규모 업데이트(v2026.3.7)는 오픈클로가 실험적 프레임워크에서 '에이전트 운영체제(Agent OS)'로 전환하는 분기점으로 평가받았습니다. 핵심은 GPT-5.4 네이티브 지원과 메모리 핫스와핑 기능으로, 자체 벤치마크(OOLONG) 테스트에서 74.8점을 기록해 같은 테스트의 Claude Code(70.3점)를 앞선다는 결과가 나오기도 했습니다. 다만 이런 급성장에는 그늘도 있었는데, 커뮤니티 스킬 마켓플레이스인 ClawHub에서 악성 스킬 400여 개가 발견되는 보안 사고도 함께 불거졌습니다. 이후 4월 업데이트(v2026.4.2)는 신기능 추가보다 내부 안정화와 보안 강화에 집중한 버전으로, 기본 보안 설정이 더 보수적으로 바뀌었습니다.

2026년 7월 최신 버전 — 원격 코딩 세션과 GPT-5.6 지원

현재 최신 정식 버전은 v2026.6.33(7월 21일 배포)이며, 2026.7.2 베타 버전도 함께 공개되어 있습니다. 이번 업데이트의 핵심은 다음과 같습니다.

  • 원격 코딩 세션 — Control UI 세션을 클라우드 워커에서 실행하고, Codex나 Claude 세션을 소유 호스트의 터미널에서 직접 열 수 있으며, OpenCode·Pi 세션도 터미널에서 바로 재개할 수 있습니다.
  • openclaw attach 명령 신설 — 기존 게이트웨이 세션에 외부 하네스를 붙여, Claude Code에 특정 세션에 대한 임시 접근 권한을 부여하거나 Codex 스타일 워크플로우를 재개·점검할 수 있게 됐습니다.
  • GPT-5.6 모델 패밀리 지원 — 카탈로그·기능·런타임 선택 전반에서 GPT-5.6을 인식하도록 업데이트됐습니다.
  • 모바일·헤드리스 리눅스 노드 자동화 — 데스크톱뿐 아니라 모바일 환경과 화면 없는 리눅스 서버에서도 네이티브 자동화가 가능해졌습니다.
  • 메신저 통합 강화 — 텔레그램은 실시간 진행 상황·사진/문서 전송·재시도 처리가, 슬랙은 스레드·카드·중복 방지가, 디스코드는 답장·음성 세션·재연결 안정성이 각각 개선됐습니다.

실무자가 알아둘 것 — 비용과 업데이트 방식

오픈클로 자체는 무료 오픈소스이지만, 실제 비용은 연결하는 LLM API 사용료에서 발생합니다. 프롬프트 최적화 없이 API를 그대로 쓰면 예상보다 비용이 많이 나올 수 있어 주의가 필요하고, 무료로 체험하고 싶다면 구글 AI 스튜디오에서 제미나이 모델의 무료 API 키를 발급받아 연동하는 방법도 있습니다. 보안을 위해 별도 서버를 호스팅하면 월 5달러 정도, 맥 미니 같은 전용 기기를 따로 마련하면 추가 비용이 발생할 수 있습니다.

또한 오픈클로는 아직 1.0 정식 출시 전 단계로 한 달에 한두 번씩 마이너 업데이트가 나올 만큼 변화가 빠릅니다. 업데이트 전에는 설정 파일과 인증 정보, 워크스페이스를 미리 백업해두고, openclaw update 명령으로 업데이트한 뒤 openclaw doctor로 설정을 점검하는 절차를 따르는 것이 권장됩니다.

지금 바로 확인하는 법 — 실전 활용 테스트 5가지

오픈클로를 도입하기 전, 메신저로 아래 5가지 명령을 직접 보내보세요.

① 문서 자동 작성 및 발송 테스트

어제 [회의명] 회의록을 바탕으로 보고서 초안을 써서 
내 이메일로 보내줘.

→ 결과: 자료를 어디서 찾아오는지, 최종 산출물의 완성도가 사람 손질 없이 쓸 만한 수준인지 확인하세요.

② 원격 코딩 세션 테스트

(연결된 저장소에서) 최근 이슈로 등록된 버그를 확인하고, 
Codex 세션을 열어서 수정 작업을 진행해줘.

→ 결과: 클라우드 워커에서 원격으로 작업을 맡기고 결과를 받는 흐름이 실제로 매끄러운지 점검하세요.

③ 메신저 연동 안정성 테스트

(슬랙/디스코드에서) 진행 중인 작업의 실시간 진행 상황을 
스레드로 계속 업데이트해줘.

→ 결과: 긴 작업 중 연결이 끊기거나 중복 메시지가 발생하지 않는지 확인하세요.

④ 외부 LLM 전환 비용 테스트

같은 작업을 (클로드 API와 로컬 LLM 각각으로) 실행해서, 
결과 품질과 소요 비용 차이를 비교해줘.

→ 결과: 어떤 모델 조합이 내 업무에 가장 비용 효율적인지 직접 확인하세요.

⑤ 보안 설정 점검

현재 설정에서 외부 스킬이나 플러그인이 
어떤 권한까지 접근할 수 있는지 정리해줘.

→ 결과: ClawHub 같은 외부 마켓플레이스 스킬을 쓰기 전, 권한 범위를 먼저 파악하는 습관이 중요합니다.

마무리 — 즉시 실행 CTA

오픈클로는 한 사람의 사이드 프로젝트에서 출발해 반년 만에 '에이전트 운영체제'를 표방할 만큼 빠르게 성장했고, 창시자가 OpenAI에 합류한 뒤에도 독립 오픈소스 프로젝트로 계속 진화하고 있습니다. 다만 성장 속도만큼 보안 이슈도 함께 불거졌던 만큼, 도입 전 권한 범위와 비용 구조부터 꼼꼼히 확인하는 것이 중요합니다.

지금 바로 ① 문서 자동 작성 및 발송 테스트부터 메신저로 보내보세요. 실제 업무 자료로 직접 확인한 결과가, 어떤 소개 글보다 정확한 판단 기준이 되어줄 것입니다.

2026년 7월 23일 목요일

Grok과 Grok Build, 파격적인 가격 정책의 자신감은 어디서 나올까? (2026년 7월)

 "이 가격에 이 정도 성능이면 써봐야 하는 거 아니야?"

Grok 4.3 API가 입력 가격을 40% 인하하고, 뒤이어 나온 Grok Build까지 업계 최저 수준의 토큰 요금을 내놓으면서 실무자들 사이에서 이런 반응이 나오고 있습니다. Claude Code, Codex와 어깨를 나란히 하겠다며 등장한 Grok Build는 API 기준 입력 100만 토큰당 단돈 0.20달러, 캐시 입력은 그보다도 더 저렴합니다. 숫자만 보면 확실히 매력적입니다.

그런데 한 가지 의문이 남습니다. 정작 코딩 벤치마크에서는 Claude Opus 4.7에 10%p 넘게 뒤처진다는 평가가 나오는데, xAI는 왜 이렇게까지 자신 있게 가격을 낮출까요? 단순히 "밀어붙이기 전략"인지, 아니면 실제로 믿는 구석이 있는지 — 1인 기업가와 비개발자 실무자 입장에서 "지금 Grok으로 갈아타는 게 맞는 선택인지"를 냉정하게 따져보겠습니다.

본론 — 가격 자신감의 배경과 실무 판단 가이드

배경 1. 압도적인 인프라 투자로 만든 '규모의 경제'

xAI는 후발주자로 시장에 뛰어든 만큼, 처음부터 속도와 물량으로 승부하는 전략을 택했습니다. 세계 최대 규모의 GPU 클러스터 프로젝트를 다른 경쟁사들이 1.9~2.1년 걸린 구축 기간을 122일 만에 끝내며 대규모 연산 인프라를 초고속으로 확보했습니다. 이후에도 클러스터 용량을 지속적으로 증설하며 연산 자원을 압도적으로 늘려왔습니다. 이런 규모의 인프라를 갖추면 토큰당 처리 비용 자체가 낮아지기 때문에, 공격적인 가격 인하가 어느 정도는 실제 원가 구조에서 나온 자신감이라고 볼 수 있습니다.

배경 2. SpaceX 편입으로 달라진 자본 구조

2026년 2월, xAI는 스페이스X에 인수되며 법인 구조가 바뀌었고, 5월에는 xAI 법인이 해산되어 스페이스X의 AI 사업부로 완전히 흡수 통합됐습니다. 이 인수 과정에서 xAI의 부채와 비용 부담이 스페이스X로 넘어가지 않도록 특수한 합병 구조가 설계되었다는 점이 알려져 있습니다. 결과적으로 xAI는 훨씬 더 크고 자금력이 탄탄한 모기업 안에서 가격 경쟁을 이어갈 수 있는 여력을 갖추게 됐습니다. 스타트업 단독으로 버티는 것과, 대형 모기업의 자본을 등에 업고 버티는 것은 '얼마나 오래 손해를 감수하며 가격을 낮출 수 있는가'의 차원이 다릅니다.

배경 3. 개발자 확보를 위한 '일단 써보게 하기' 전략

Grok Build는 코딩 벤치마크에서 아직 최상위권이 아니라는 평가를 받습니다. 실제로 SWE-bench 같은 코딩 지표에서 Claude Opus 4.7보다 뒤처진다는 분석이 나온 바 있습니다. 반면 장기간 여러 단계를 거치는 에이전트형 작업에서는 오히려 더 높은 효율을 보인다는 평가도 있어, 강점과 약점이 뚜렷하게 갈립니다. 이런 상황에서 가격을 낮추는 건 "성능으로 아직 못 이기니 가격으로 일단 써보게 만들자"는, 후발주자의 전형적인 시장 진입 전략에 가깝습니다. 실제로 업계에서는 "가격만으로 개발자 생태계를 구축한 사례는 역사적으로 없다"는 비판적 시각도 함께 나오고 있어, 이 자신감이 실제 실력에 대한 확신인지 시장 점유율 확보를 위한 승부수인지는 조금 더 지켜볼 필요가 있습니다.

배경 4. 캐싱 구조로 체감 비용을 한 번 더 낮추는 설계

Grok Build는 별도 설정 없이 프롬프트 캐싱이 자동 적용되고, 캐시된 입력은 정가 대비 대폭 할인된 가격으로 처리됩니다. 반복적으로 같은 코드베이스나 문서를 참조하는 작업(리팩토링, 문서 업데이트 등)에서는 실질 비용이 표기된 단가보다 훨씬 낮아질 수 있습니다. 즉, 표면적인 가격 인하뿐 아니라 '반복 작업 구조에서 추가로 더 아낄 수 있게' 설계했다는 점도 자신감의 한 축입니다.

배경 5. 아직은 '얼리 베타' — 완성형 생태계는 아니다

다만 냉정하게 볼 부분도 있습니다. Grok Build는 아직 공개 베타 단계이고, 가격과 기능이 언제든 바뀔 수 있다는 안내가 붙어 있습니다. 또한 MCP 연동, 장기 메모리, 프로젝트 관리 기능 등 Claude Code나 Codex가 이미 갖춘 개발자 편의 기능들이 아직 부족하다는 지적도 있습니다. 가격은 매력적이지만, "업무에 바로 투입 가능한 완성형 도구"인지는 별개로 판단해야 합니다.

지금 바로 확인하는 법 — 도입 전 테스트 프롬프트 5가지

Grok과 Grok Build를 실제 업무에 쓸지 판단하기 전에, 아래 5가지를 직접 테스트해보세요.

① 실제 비용 비교 계산

지난달 내가 코딩/문서 작업에 사용한 토큰량을 기준으로, 
Grok Build(입력 $0.20/1M, 출력 $2.00/1M)와 
현재 쓰는 도구의 요금제를 비교해서 월간 예상 비용 차이를 계산해줘.

→ 결과: 캐시 할인까지 반영했을 때도 유의미한 차이가 없다면, 가격만 보고 갈아탈 이유는 크지 않습니다.

② 실제 코드 리팩토링 정확도 테스트

[실제 업무에서 다뤘던 중간 난이도 코드]를 리팩토링해줘. 
결과를 기존에 쓰던 도구의 결과와 비교해줘.

→ 결과: 코드 품질 차이가 크다면, 가격 이점보다 정확도 손실이 더 큰 리스크일 수 있습니다.

③ 장기 에이전트 작업 효율 테스트

여러 단계로 이어지는 작업(예: 데이터 수집 → 정리 → 보고서 초안 작성)을 
한 번에 맡겨서 끝까지 처리하는 속도와 완성도를 확인해줘.

→ 결과: 여러 단계를 거치는 반복 업무가 많다면, Grok Build의 강점이 실제로 발휘될 가능성이 높습니다.

④ 캐싱 할인 체감 테스트

같은 문서나 코드베이스를 참조하는 질문을 연속으로 5회 이상 반복 요청하고, 
캐싱 적용 전후의 체감 응답 속도와 비용 변화를 기록해줘.

→ 결과: 반복 참조가 많은 업무일수록 캐싱 이점을 크게 누릴 수 있습니다.

⑤ 생태계 제약 확인 테스트

평소 업무에 필수적인 외부 연동(캘린더, 협업 툴, 사내 문서 등)을 
Grok Build 환경에서도 그대로 연결할 수 있는지 확인해줘.

→ 결과: 필수 연동이 막힌다면, 가격이 아무리 저렴해도 주력 도구로 쓰기엔 아직 이르다는 신호입니다.

마무리 — 즉시 실행 CTA

Grok과 Grok Build의 가격 자신감은 막연한 배짱이 아니라, 대규모 인프라 투자와 SpaceX 편입에 따른 자본 여력, 그리고 후발주자로서 개발자를 빠르게 끌어들이려는 시장 전략이 겹친 결과입니다. 다만 아직 얼리 베타 단계인 만큼, 가격만 보고 성급하게 주력 도구를 바꾸기보다는 위 5가지 테스트로 내 업무 패턴에 실제로 이득이 되는지부터 확인해보시길 권합니다.

지금 바로 ① 실제 비용 비교 계산 프롬프트부터 실행해보세요. 계산 결과가 기대 이상이라면, 다음 포스팅에서 다룰 "AI 코딩 에이전트 3사 실전 비교(Claude Code vs Codex vs Grok Build)"도 함께 참고하시길 추천드립니다.

Claude 5시간 사용량 제한, 합리적일까? | 누구를 위한 한도인지 뜯어봤습니다 (2026)

 

도입부 — 흐름 탈 때 뜨는 그 한 줄, "사용량 한도에 도달했습니다"

한창 작업 흐름을 타고 있을 때가 있습니다. Claude와 코드를 주고받으며 문제가 술술 풀리고, 다음 단계가 눈앞에 보이는 순간 — "사용량 한도에 도달했습니다. 몇 시간 후 다시 시도하세요." 집중이 끊기고, 리듬이 무너지고, "돈 내고 쓰는데 왜?"라는 생각이 스칩니다.

Claude를 진지하게 쓰는 사람이라면 한 번쯤 겪는 순간입니다. 그래서 오늘은 감정이 아니라 사실과 구조로 이 질문에 답해보려 합니다. 이 제한은 어떻게 작동하고, 왜 존재하며, 결국 누구를 위한 것일까요? 한쪽으로 치우치지 않고, 마지막엔 한도를 아끼는 실전 방법까지 드리겠습니다.


본론 1 — 먼저 정확히: '5시간 일일 제한'이라는 흔한 오해

많은 사람이 이걸 "하루 5시간 쓰면 끝"이라고 오해합니다. 실제 구조는 다릅니다. Claude는 이중 한도 시스템으로 돌아갑니다.

  • ① 5시간 롤링 창: 하루 단위가 아니라, 첫 메시지를 보낸 순간 타이머가 시작돼 정확히 5시간 뒤에 리셋됩니다. 시계(자정)가 아니라 내 사용 시점을 따라 움직입니다. 오전 10시에 첫 질문을 하면 오후 3시에 리셋되는 식이죠.
  • ② 주간 상한: 5시간 창 위에 주간 한도가 하나 더 얹혀 있습니다. 이건 롤링이 아니라 계정마다 지정된 요일·시각에 고정으로 리셋됩니다. 그래서 여러 세션에 나눠 써도, 한 주 총량이 크면 수요일쯤 벽에 부딪힐 수 있습니다.
  • ③ 공유 버킷: 여기가 핵심입니다. claude.ai 채팅, Claude Code, Claude 데스크톱이 같은 한도를 나눠 씁니다. 오후 내내 Claude Code로 에이전트 코딩을 돌렸다면, 저녁에 쓸 채팅 용량이 조용히 사라져 있을 수 있습니다.

플랜별 대략적 용량(2026년 중반 기준, 자주 바뀜)은 무료 약 15~40메시지/5시간, Pro($20)는 그 약 5배, Max 5x($100)는 약 225메시지, Max 20x($200)는 약 900메시지 수준입니다.

🖊️ 에디터 팁 — Anthropic은 배수(1x·5x·20x)만 공개하고 정확한 토큰량은 더 이상 공개하지 않습니다. 즉 "5배"라는 비율은 알려주지만 "무엇의 5배"인지는 흐릿하고, 한도는 언제든 바뀔 수 있습니다. 이 불투명성이 뒤에서 다룰 비판의 핵심입니다.


본론 2 — 왜 이런 제한을 두는가 (명분과 비판)

Anthropic이 내세우는 명분

  • 공정성과 안정성: 소수의 초고사용자가 자원을 독식하면 다수의 경험이 나빠집니다. 한도는 "모두가 안정적으로 쓰게" 하는 배급 장치라는 설명입니다.
  • 남용 방지: 24시간 무한 구동, 계정 공유·재판매 같은 오용을 막기 위해 주간 한도를 도입했다고 밝혔습니다. 실제로 한도를 '줄인' 게 아니라 구조를 '재편'했다는 입장입니다.
  • 비용의 현실: 프론티어 모델 추론은 대량의 GPU와 전력을 태웁니다. 정액 구독($20~200)으로 무제한을 보장하는 건 구조적으로 불가능에 가깝습니다.

사용자 쪽의 정당한 비판

  • 예측 불가능성: 정확한 토큰량이 비공개라, 언제 벽에 부딪힐지 가늠하기 어렵습니다.
  • 공유 버킷의 함정: 코딩과 채팅이 한 지갑을 쓴다는 걸 모르면, 갑작스러운 소진에 당황합니다.
  • 작업 중단의 비용: 흐름이 끊기는 건 단순 불편을 넘어 생산성 손실입니다. 특히 마감 중이라면요.

이 제한은 계속 조정돼 왔습니다. 2026년 3월엔 평일 피크시간 한도를 축소했다가 "예상보다 빨리 한도에 걸린다"는 지적을 받았고, 5월엔 5시간 한도를 2배로 늘리고 피크시간 축소를 폐지했습니다. 6월엔 비대화형(에이전트 SDK·자동화) 사용을 별도 크레딧으로 분리했습니다. 완성된 정책이 아니라, 피드백에 따라 흔들리며 다듬어지는 중이라는 뜻입니다.


본론 3 — 그래서, 누구를 위한 제한인가?

정직하게 보면 이 질문엔 하나의 답이 없습니다. 입장별로 나눠 봐야 합니다.

  • 다수의 일반 사용자에게는 — 보호 장치에 가깝습니다. 소수 헤비 유저가 자원을 빨아들이는 걸 막아, 평범한 사용자가 안정적으로 쓰게 해줍니다.
  • 헤비 유저(개발자·1인 창작자)에게는 — 페널티처럼 느껴집니다. 돈을 더 내고도 벽에 부딪히고, 그 벽의 위치조차 흐릿합니다. 신뢰를 갉아먹는 지점입니다.
  • Anthropic에게는 — 지속가능성 장치입니다. 폭주하는 비용과 유한한 연산 자원 안에서 서비스를 유지하려는 방어선입니다.

핵심은 이겁니다. 정액 구독(Pro/Max)은 '무제한 생산 도구'가 아니라 '대화형 인간 작업용' 요금제입니다. 24시간 자동화나 안정적 대량 처리가 목적이라면, 설계상 그 용도는 종량제 API입니다. "구독인데 왜 막지?"라는 불만의 상당 부분은, 구독 상품을 프로덕션 도구로 오해한 데서 옵니다.

그러니 "합리적인가?"에 대한 균형 잡힌 답은 — 원리는 합리적이고, 실행은 논쟁적입니다. 배급이라는 발상 자체는 타당하지만, 불투명성·공유 버킷·작업 중단이라는 실행의 거친 부분은 분명 개선 여지가 있습니다.

🖊️ 에디터 팁 — 본인이 "헤비 유저"라면, 감정적으로 싸우기보다 워크플로를 구독+API 하이브리드로 설계하는 편이 현실적입니다. 일상 작업은 구독으로, 한도를 넘길 무거운 작업은 API로 넘기는 식이죠.


본론 4 — 한도를 아끼는 실전 6가지 (즉시 실행)

구조를 알면 대응이 보입니다. 오늘 바로 적용할 수 있는 방법들입니다.

① 붙여넣기 다이어트

프롬프트: 문서 전체 대신 이 함수와 관련된 부분만 검토해줘처럼 필요한 조각만 첨부. 결과: 입력 토큰이 줄어 같은 창에서 더 많은 작업을 소화합니다.

② 한 메시지에 묶어 묻기

프롬프트: 아래 3가지를 한 번에 처리해줘: 1) … 2) … 3) … 결과: 왕복 횟수가 줄어 5시간 창 소모가 완만해집니다.

③ 작업에 맞는 모델 라우팅

워크플로: 단순 요약·분류는 가벼운 모델, 복잡한 추론·코딩만 상위 모델. 결과: 무거운 모델을 아껴 주간 상한까지 여유가 생깁니다.

④ 긴 작업은 Projects/맥락 정리로

프롬프트: 지금까지 핵심을 5줄로 요약해줘. 다음부턴 이 요약을 기준으로 진행. 결과: 매번 긴 맥락을 다시 넣지 않아 토큰이 절약됩니다.

⑤ 코딩과 채팅의 '지갑 공유'를 계산에 넣기

워크플로: 에이전트 코딩을 길게 돌린 날은 저녁 채팅 용량이 줄었다고 가정하고 배분. 결과: 예상치 못한 소진으로 흐름이 끊기는 사고를 예방합니다.

⑥ 무거운 작업은 API로 오프로딩

워크플로: 대량·자동화·백그라운드 작업은 구독이 아니라 종량제 API로. 결과: 5시간 창에 걸리지 않고, 구독 한도는 인터랙티브 작업에 온전히 씁니다.


마무리 — 벽에 부딪혔다면, 오늘 하나만 바꿔보세요

Claude의 사용량 제한은 없어지지 않을 겁니다. 연산은 유한하고 비용은 실재하니까요. 하지만 그 제한 안에서 얼마나 멀리 갈지는 설계에 달려 있습니다.

  1. 최근 한도에 걸렸던 작업을 떠올리고,
  2. 위 6가지 중 본인에게 가장 급한 것 하나를 골라,
  3. 다음 작업부터 바로 적용해보세요.

"돈 내고도 막힌다"는 억울함을, "구조를 알고 아껴 쓴다"는 통제감으로 바꾸는 게 오늘의 목표입니다.

👉 오늘의 실행 과제: 본인의 사용 패턴이 '인터랙티브형'인지 '자동화·대량형'인지 한 문장으로 정의하기. 후자라면, 구독만 고집하지 말고 API 하이브리드를 검토할 때입니다.

⚠️ 사용량 한도·가격·정책은 수시로 바뀝니다. 이 글은 2026년 중반 공개 정보를 바탕으로 한 분석이며, 정확한 현재 수치는 Anthropic 공식 헬프센터에서 확인하세요.


이 글은 특정 기업 옹호나 비방이 아니라, 공개된 정책과 사용자 피드백을 바탕으로 '요금제 구조의 합리성'을 실무 관점에서 분석한 것입니다.

2026년 7월 21일 화요일

Gemini는 왜 점점 퇴보할까? 체감 성능 저하 원인 5가지 (2026년 7월 기준)

 "어제까지 잘 되던 걸 왜 오늘은 못 하지?"

Gemini를 업무에 쓰는 분이라면 한 번쯤 이런 순간을 겪어보셨을 겁니다. 분명 구글은 신모델을 낼 때마다 "역대 최고 성능"이라고 발표하는데, 정작 써보면 예전보다 답답해졌다는 느낌을 받는 경우가 많습니다. 실제로 커뮤니티에서는 "요즘 확실히 제미나이가 멍청해졌다", "환각이 심해서 우기기까지 한다"는 후기가 꾸준히 올라오고 있고, 사용량 한도가 갑자기 줄어들어 업무 중간에 모델이 막혀버렸다는 불만도 이어지고 있습니다.

문제는 이게 단순히 "기분 탓"이 아니라는 겁니다. 벤치마크 점수와 실사용 체감 사이의 괴리, 잦은 모델 교체, 사용량 정책 변경까지 — 실제로 확인 가능한 원인들이 존재합니다. 오늘은 1인 기업가와 실무자 입장에서 "Gemini가 왜 점점 퇴보하는 것처럼 느껴지는지"를 정리하고, 지금 내가 쓰는 Gemini가 실제로 내 업무에 믿을 만한지 5분 안에 직접 진단하는 방법까지 알려드리겠습니다.

본론 — 원인 분석 및 실무 진단 가이드

원인 1. 벤치마크는 오르는데 체감은 내려가는 '역성장' 현상

Gemini 3.1, 3.5로 넘어오면서 각종 벤치마크 점수는 계속 상승했지만, 실제 사용자들 사이에서는 오히려 "체감 성능이 떨어졌다"는 평가가 늘고 있습니다. 커뮤니티에서 자주 지적되는 문제는 크게 세 가지입니다.

  • 기억 유지력 저하 — 긴 대화나 문서 작업 중간에 앞의 맥락을 놓치는 경우
  • 환각(할루시네이션) 심화 — 없는 사실을 그럴듯하게 만들어내고, 지적해도 우기는 경향
  • 과도한 동조 편향 — 사용자 의견에 무조건 맞장구치며 틀린 답을 정답처럼 밀어붙이는 경향

벤치마크는 정해진 문제 세트를 얼마나 잘 푸는지를 측정하지만, 실무는 맥락 유지·정확한 팩트체크·비판적 검토가 훨씬 더 중요합니다. 이 간극이 "숫자는 좋아졌는데 왜 이렇게 답답하지"라는 체감으로 이어지는 것입니다.

원인 2. 사용량 한도가 갑자기 확 줄었다

2026년 5월 17일부로 Gemini 앱의 사용량 정책이 토큰 기반 5시간/주간 한도제로 전면 개편되었습니다. 문제는 이 과정에서 텍스트·이미지·영상 등 모든 기능의 사용량이 하나로 통합되면서, 기존 대비 한도가 대폭 줄어들었다는 점입니다. 한도를 다 쓰지도 않았는데 "수요 폭주"를 이유로 상위 모델(Pro) 사용이 강제로 제한되는 사례도 보고되고 있습니다.

실무에서 한창 문서를 작성하거나 리서치를 하다가 갑자기 모델이 하위 버전으로 전환되면, 결과물의 품질이 뚝 떨어지는 걸 바로 체감하게 됩니다. "어제는 됐는데 오늘은 안 된다"는 느낌의 상당 부분은 여기서 비롯됩니다.

원인 3. 숨겨진 'thinking tokens' 과금 구조

Gemini 3.5 Flash처럼 기본값으로 '사고(Thinking)' 기능이 켜져 있는 모델은, 사용자 화면에는 보이지 않는 내부 추론 과정에도 토큰 비용이 부과됩니다. 문제는 답변 전 추론 과정에서 소비되는 토큰이 대화 턴마다 누적되면서, 체감 청구 비용이 실제 단가 계산보다 훨씬 크게 불어날 수 있다는 점입니다. 해외 개발자 커뮤니티에서는 "Flash라는 이름값에 안 맞게 비용이 Pro급으로 나온다"는 지적이 반복적으로 제기되고 있습니다. API로 자동화 워크플로우를 돌리는 실무자라면 특히 체크가 필요한 부분입니다.

원인 4. 잦은 모델 교체와 조기 지원 종료

Gemini 3 Pro는 출시 후 오래 지나지 않아 API 지원 종료 일정이 공지되었고, 이후 자동으로 후속 모델로 전환되는 방식이 반복되고 있습니다. 업무 자동화나 프롬프트를 특정 모델 버전에 맞춰 최적화해 둔 사용자 입장에서는, 모델이 예고 없이 바뀌면서 결과물의 톤이나 정확도가 흔들리는 경험을 하게 됩니다. 실제로 신형 모델(3.5 Pro)조차 초기 피드백 반영을 이유로 출시가 두 차례 연기된 바 있어, 구글 내부적으로도 품질 안정화에 어려움을 겪고 있다는 정황이 있습니다.

원인 5. 공식 앱 vs API의 체감 성능 차이

같은 Gemini 모델이라도 공식 앱(Gemini App)과 API(AI Studio, Vertex AI 등)는 기본으로 깔리는 시스템 프롬프트가 다르기 때문에 결과물 톤과 정확도에 차이가 발생합니다. 공식 앱에서 유독 답답함을 느꼈다면, 같은 모델을 API 환경에서 다시 테스트해보는 것도 원인을 좁히는 방법입니다.

지금 바로 확인하는 법 — 진단 프롬프트 5가지

내가 쓰는 Gemini가 실제로 내 업무에 문제가 있는 수준인지, 아래 프롬프트로 5분 안에 점검해보세요.

① 맥락 유지력 테스트

지금부터 5턴 동안 대화할 예정입니다. 
[프로젝트명, 예산, 마감일] 세 가지 조건을 기억한 채로 답변해주세요.
(5턴 뒤) 처음에 제가 알려드린 세 가지 조건을 다시 말해주세요.

→ 결과: 조건이 하나라도 틀리거나 누락되면 장문 작업(보고서, 기획서)에는 부적합하다고 판단하세요.

② 할루시네이션(환각) 검증 테스트

[내가 실제로 아는 특정 통계나 최근 사건]에 대해 정확한 수치를 알려줘. 
모르면 모른다고 답하고, 절대 추측해서 답하지 마.

→ 결과: 틀린 수치를 확신에 찬 어조로 답하면, 팩트가 중요한 업무(보고서·기사)에는 반드시 별도 검증 절차를 추가해야 합니다.

③ 동조 편향(아부성 답변) 테스트

[의도적으로 틀린 주장]을 하고 이게 왜 맞는지 설명해줘.

→ 결과: 명백히 틀린 주장에도 논리를 만들어 맞장구치면, 기획·전략 자문용으로 쓰기엔 위험 신호입니다.

④ 사용량 한도 소진 시점 테스트

(같은 계정에서) 오늘 하루 동안 사용한 텍스트/이미지/영상 기능을 모두 기록해두고, 
Pro 모델이 강제로 하위 모델로 전환되는 시점을 체크하세요.

→ 결과: 예상보다 훨씬 이른 시점에 전환된다면, 업무 시간대를 한도 초기화 직후로 조정하거나 요금제 상향을 검토하세요.

⑤ 앱 vs API 비교 테스트

(동일 프롬프트를) Gemini 공식 앱과 AI Studio(API)에서 각각 실행해 답변을 비교하세요.

→ 결과: 답변 품질 차이가 크다면, 중요한 작업은 API 환경에서 처리하는 것이 더 안정적일 수 있습니다.

마무리 — 즉시 실행 CTA

"Gemini가 예전 같지 않다"는 느낌은 착각이 아니라, 사용량 정책 변경·모델 교체·과금 구조 변화가 겹쳐서 나타나는 실제 현상입니다. 중요한 건 막연히 불만을 갖기보다, 위 5가지 프롬프트로 내 업무에 실제로 영향이 있는지 직접 확인하는 것입니다.

지금 바로 브라우저를 열어 ① 맥락 유지력 테스트부터 실행해보세요. 결과가 걱정했던 것보다 심각하다면, 다음 포스팅에서 다룰 "AI 도구별 업무 배분 전략"으로 리스크를 분산하는 방법을 함께 확인해보시길 추천드립니다.

2026년 7월 19일 일요일

Claude Opus 4.8·Fable 5·GPT-5.6 성능 비교: 어떤 AI가 가장 좋을까?

Claude Opus 4.8 · Fable 5 · GPT-5.6 성능 비교: 어떤 AI가 가장 좋을까?

최근 생성형 AI 시장에서는 단순히 "어느 모델이 벤치마크 점수가 가장 높은가"보다, 내가 실제로 하는 작업에서 어느 모델이 더 안정적이고 경제적인가가 중요해졌습니다.

이 글에서 비교하는 세 모델은 다음과 같습니다.

모델 출시일 제조사
Claude Opus 4.8 2026년 5월 28일 Anthropic
Claude Fable 5 2026년 6월 9일 Anthropic
GPT-5.6 (Sol/Terra/Luna) 2026년 7월 9일 OpenAI

GPT-5.6은 하나의 모델이 아니라 세 가지 등급으로 구성됩니다.

  • GPT-5.6 Sol: 최고 성능 모델
  • GPT-5.6 Terra: 성능과 비용의 균형형
  • GPT-5.6 Luna: 속도와 비용 효율형

OpenAI는 "숫자는 세대를 뜻하고, Sol·Terra·Luna는 각자의 속도로 발전하는 지속적인 성능 등급"이라고 설명합니다. 따라서 Fable 5나 Opus 4.8과 최고 성능을 비교할 때는 주로 GPT-5.6 Sol을 기준으로 봐야 합니다.

읽기 전 주의사항 이 글에 인용된 벤치마크 수치는 상당 부분 각 회사가 직접 선택해 공개한 비교 자료입니다. 자사에 유리한 항목이 선별될 수밖에 없으므로, 절대적인 순위표가 아니라 "대략적인 성향 지도"로 읽는 것이 안전합니다. 또한 같은 모델이라도 추론 강도(effort/reasoning) 설정에 따라 점수와 비용이 크게 달라집니다.


세 모델의 핵심 차이 한눈에 보기

비교 항목 Claude Opus 4.8 Claude Fable 5 GPT-5.6 Sol
모델 성격 안정적인 고성능 범용 모델 Anthropic 최상위(Mythos급) 모델 OpenAI 최고 성능 범용·에이전트 모델
가장 강한 분야 판단력, 장문 작성, 신중한 검토 복잡한 분석, 장기 작업, 지식 업무 코딩 에이전트, 도구 사용, 업무 자동화
코딩 성능 매우 우수 (특히 결함 탐지) 최상위권 코딩 에이전트 평가에서 최고
업무 문서 자연스럽고 신중함 깊고 정교한 결과 구조화·도구 연계에 강함
긴 작업 수행 안정적 작업이 길고 복잡할수록 격차 확대 프로그램형 도구 호출에 강함
답변 성향 신중하고 비판적 깊고 집요하게 분석 빠르게 구조화하고 실행
컨텍스트 100만 토큰 100만 토큰 대용량 (272K 초과 시 요금 가중)
안전 제한 비교적 엄격 민감 요청은 Opus 4.8로 전환 분야별 강화된 안전 정책
API 가격(100만 토큰) $5 / $25 $10 / $50 $5 / $30
추천 사용자 기획자·작가·의사결정 검토 전문 분석·연구·대형 프로젝트 코딩·자동화·멀티도구 사용자

1. 전체 지능과 추론 성능

전체 지능을 하나의 숫자로 결정하기는 어렵습니다. 벤치마크마다 측정하는 능력이 다르기 때문입니다.

독립 평가기관 Artificial Analysis의 Intelligence Index(각 모델 최대 추론 설정 기준)에서는 Fable 5와 GPT-5.6 Sol이 1점 내외 차이로 사실상 동급이며, 그 아래에 Opus 4.8과 GPT-5.6 Terra·Luna가 위치합니다.

모델 대략적 위치
Claude Fable 5 (max) 최상위 (약 60)
GPT-5.6 Sol (max) 최상위 (약 59)
Claude Opus 4.8 상위 (약 56)
GPT-5.6 Terra 중상위 (약 55)
GPT-5.6 Luna 중위 (약 51)

주목할 점은 비용 대비 효율입니다. Artificial Analysis에 따르면 Sol은 Fable 5보다 1점 낮은 점수를 작업당 약 3분의 1 비용으로 달성했습니다.

반대로 업무 수행형 평가에서는 순위가 달라집니다. OpenAI가 공개한 경영 컨설팅 업무 평가에서는 GPT-5.6 Sol이 43.2%, Fable 5가 35.5%, Opus 4.8이 31.6%를 기록했습니다. 장기 전문 업무를 평가하는 Agents' Last Exam에서도 Sol이 53.6으로 최고치를 기록했다고 발표했습니다. (단, 이 두 수치는 모두 OpenAI 자체 발표입니다.)

정리하면 이렇게 해석하는 것이 정확합니다.

  • 순수 종합 지능과 복잡한 추론: Fable 5가 근소 우위
  • 실제 업무를 단계별로 끝내는 능력: GPT-5.6 Sol이 강함
  • 비용까지 함께 고려한 지능: GPT-5.6 Sol이 유리
  • 안정적인 판단과 장문 협업: Opus 4.8이 여전히 경쟁력 있음

2. 코딩 성능 비교

코딩은 GPT-5.6이 가장 강하게 내세우는 영역입니다.

GPT-5.6 Sol은 Artificial Analysis Coding Agent Index에서 80점을 기록해 Fable 5보다 2.8점 높았습니다. OpenAI는 이 과정에서 출력 토큰과 수행 시간이 절반 이하, 예상 비용은 약 3분의 1 수준이었다고 설명합니다.

다만 벤치마크를 하나 더 보면 결론이 뒤집힙니다. 실제 저장소 이슈를 해결하는 SWE-Bench Pro에서는 Sol이 64.6%로, Mythos급 모델(약 80%)에 15%p가량 뒤집니다. 즉 "에이전트로서 작업을 효율적으로 끝내는 능력"과 "어려운 코드 문제 자체를 푸는 능력"은 다르게 측정됩니다.

GPT-5.6 Sol이 적합한 경우

  • Codex로 실제 프로젝트를 개발할 때
  • 여러 파일과 도구를 동시에 다룰 때
  • 속도와 비용까지 중요할 때
  • 코드 작성부터 테스트·배포까지 맡길 때

Fable 5가 적합한 경우

  • 복잡한 앱 구조를 처음부터 설계할 때
  • 대규모 리팩터링 계획을 만들 때
  • 난도 높은 버그를 끝까지 파고들어야 할 때
  • 장시간 이어지는 개발 작업을 맡길 때

Opus 4.8이 적합한 경우

  • 중요한 코드 변경을 신중하게 검토할 때
  • 설계안의 허점을 찾을 때
  • 개발 계획과 위험성을 비판적으로 평가할 때

Anthropic은 Opus 4.8이 큰 변경을 하기 전에 문제를 탐색하고, 잘못된 계획을 지적하며, 자신의 실수를 더 잘 발견하도록 개선됐다고 설명합니다. 특히 코드 결함 탐지 능력이 이전 모델 대비 약 4배 향상됐다고 밝혔는데, 코드 리뷰나 보안 감사 파이프라인에서는 이 차이가 실질적입니다.

코딩 종합 판단

에이전트형 개발 워크플로 전체를 기준으로 하면 현재 GPT-5.6 Sol이 가장 실용적입니다. 다만 순수한 문제 해결 난도와 복잡한 설계에서는 Fable 5가 앞서는 평가도 있으므로, "코딩 1위"를 단정하기보다 어떤 코딩 작업인지로 나눠 보는 편이 정확합니다.


3. 기획·보고서·시장조사 성능

문서와 기획 업무에서는 단순 정확도보다 다음 요소가 중요합니다.

  • 문제를 올바르게 정의하는가
  • 빠진 조건을 발견하는가
  • 반대 의견을 검토하는가
  • 장문의 논리를 유지하는가
  • 출처와 사실을 구분하는가

Claude Opus 4.8

사용자 의견에 무조건 동의하기보다 계획의 문제점을 지적하고, 논리가 약한 부분에서 반론을 제시하는 성향이 강합니다.

적합한 업무: 사업계획서 검토, 전략 보고서 비판, 계약·정책 문서 분석, 장문 원고 작성, 의사결정 위험요소 검토.

Claude Fable 5

Anthropic은 Fable 5에 대해 **"작업이 길고 복잡할수록 다른 자사 모델과의 격차가 커진다"**고 설명했습니다. 소프트웨어 공학뿐 아니라 지식 업무, 시각 자료, 과학 연구에서도 일반 공개된 자사 모델 중 가장 강력하다고 밝혔습니다.

적합한 업무: 여러 문서를 종합한 분석, 장기 리서치, 복잡한 데이터 관계 파악, 전략 시나리오 작성, 대규모 프로젝트 계획.

GPT-5.6 Sol

분석 결과를 문서에만 머물게 하지 않고, 프로그램과 도구를 사용해 실제 산출물로 만드는 데 강합니다. OpenAI는 GPT-5.6 Sol이 발표자료·문서·스프레드시트 품질을 개선해 완전히 편집 가능한 프레젠테이션을 처음부터 생성할 수 있다고 설명합니다.

또한 API에는 모델이 직접 작성한 코드로 도구 호출을 조율하는 Programmatic Tool Calling(격리된 V8 런타임, 네트워크 차단)과, 복수 하위 에이전트를 병렬 실행하는 멀티에이전트 기능이 도입됐습니다.

종합 판단

  • 가장 깊은 분석: Fable 5
  • 가장 신중한 비판과 판단: Opus 4.8
  • 조사부터 결과물 제작까지: GPT-5.6 Sol

4. 글쓰기와 창작 능력

글쓰기 성능은 벤치마크보다 사용자의 취향에 크게 좌우됩니다. 아래는 수치가 아니라 일반적으로 보고되는 성향입니다.

Opus 4.8 — 긴 문맥 유지, 자연스러운 문장 연결, 과도하게 요약하지 않는 설명, 섬세한 감정 표현, 문체와 톤 유지. 소설·에세이·칼럼·브랜드 스토리처럼 완성된 글의 질이 중요한 작업에 적합합니다.

Fable 5 — Opus의 글쓰기 성향을 유지하면서 더 복잡한 구조와 더 긴 프로젝트를 다룹니다. 장편 원고, 세계관 관리, 여러 문서의 문체 통합, 고난도 구조 재설계에 유리합니다. 다만 짧은 게시물이나 카피에는 비용 대비 과합니다.

GPT-5.6 — 글 자체의 감성보다 목적과 형식에 맞는 결과물을 빠르게 만드는 데 강합니다. SEO 원고, 보고서, 광고 문구, 이메일, 콘텐츠 캘린더, 표·체크리스트, 플랫폼별 문구 변환에 적합합니다.

추천

  • 감성적이고 자연스러운 장문: Opus 4.8
  • 복잡한 장편 프로젝트: Fable 5
  • SEO·마케팅·실무 문서: GPT-5.6

5. 에이전트와 컴퓨터 작업 능력

2026년의 AI 경쟁은 답변 품질보다 실제로 일을 끝내는 능력으로 이동하고 있습니다.

GPT-5.6

프로그램을 작성해 도구 사용 과정을 조정하고, 중간 결과를 확인하고, 다음 행동을 결정할 수 있습니다. 하위 에이전트 4개를 병렬 실행하는 ultra 모드는 Terminal-Bench 2.1 점수를 88.8%에서 91.9%로 끌어올렸다고 발표됐습니다.

Fable 5

장기 에이전트 작업에서 뛰어난 능력을 보이지만, 안전상 민감한 요청에서는 응답이 Opus 4.8로 전환됩니다. Anthropic은 이 안전장치가 평균적으로 전체 세션의 5% 미만에서 작동하며, 빠른 출시를 위해 보수적으로 설정했기 때문에 무해한 요청도 가끔 걸린다고 밝혔습니다.

Opus 4.8

에이전트가 잘못된 방향으로 성급하게 실행하는 문제를 줄이는 데 강점이 있습니다. 웹 에이전트 평가인 Online-Mind2Web에서 84%를 기록했고, Legal Agent Benchmark에서는 해당 벤치마크 최초로 10% 이상 달성률을 기록했습니다.

추천

  • 다양한 도구를 연결해 결과를 완성: GPT-5.6
  • 장시간 복잡한 작업: Fable 5
  • 실수 방지와 신중한 실행: Opus 4.8

6. 속도와 비용 효율

API를 사용하는 기업과 개발자에게는 최고 점수보다 비용이 중요합니다.

100만 토큰 기준 공식 가격

모델 입력 출력
Claude Fable 5 $10 $50
Claude Opus 4.8 (일반) $5 $25
Claude Opus 4.8 (빠른 모드) $10 $50
GPT-5.6 Sol $5 $30
GPT-5.6 Terra $2.50 $15
GPT-5.6 Luna $1 $6

꼭 알아둘 과금 조건

  • Opus 4.8의 빠른 모드는 일반 모드보다 약 2.5배 빠르며, 이전 세대 빠른 모드보다 3배 저렴해졌습니다.
  • GPT-5.6부터는 캐시 쓰기가 일반 입력 요금의 1.25배로 과금됩니다. 캐시 읽기 90% 할인은 유지됩니다.
  • GPT-5.6은 약 27만 2천 토큰을 넘는 프롬프트에 대해 입력 요금이 2배로 적용됩니다. 대형 코드베이스를 통째로 넣을 때 중요합니다.
  • Fable 5는 트래픽에 30일 데이터 보존 정책이 적용됩니다(학습에는 사용하지 않는다고 밝힘). 민감 데이터를 다루는 조직은 확인이 필요합니다.

OpenAI는 Terra와 Luna가 일부 평가에서 Fable 5를 앞서면서 비용은 훨씬 낮다고 설명하지만, 이는 OpenAI가 선택해 공개한 비교라는 점을 감안해야 합니다.

비용 효율 추천

  • 최고 성능이 반드시 필요: GPT-5.6 Sol 또는 Fable 5
  • 일상적인 고난도 업무: GPT-5.6 Terra
  • 대량 처리와 반복 자동화: GPT-5.6 Luna
  • 신중한 장문 분석과 개발 검토: Opus 4.8

실제 사용자 유형별 추천

1인 기업가와 기획자 → GPT-5.6 Sol 또는 Terra 시장조사, 보고서, 표, 문서, 자동화까지 하나의 작업 흐름에서 처리하기 좋습니다.

개발자 → GPT-5.6 Sol Codex와 함께 코드 작성, 테스트, 수정, 터미널 사용, 배포를 연결하기 좋습니다. 대규모 앱 설계와 복잡한 리팩터링에서는 Fable 5를 보조로 함께 쓸 가치가 있습니다.

작가와 콘텐츠 제작자 → Claude Opus 4.8 문맥 유지, 감정선, 비판적 편집이 중요할 때 적합합니다. 장편이나 대규모 세계관 프로젝트라면 Fable 5가 유리할 수 있습니다.

연구자와 전문 분석가 → Claude Fable 5 긴 자료를 읽고 복잡한 관계를 파악하거나, 여러 단계의 가설을 검토하는 작업에 적합합니다.

AI 자동화 구축자 → GPT-5.6 도구 호출, 프로그램 실행, 하위 에이전트 분배, 구조화된 결과 생성에 유리합니다.

중요한 의사결정을 검토하는 사용자 → Claude Opus 4.8 무조건 동의하는 답보다 계획의 위험과 논리적 허점을 지적하는 역할에 강합니다.


바로 테스트할 수 있는 비교 프롬프트 5가지

벤치마크보다 정확한 판단 기준은 내 업무로 직접 돌려보는 것입니다. 같은 프롬프트를 세 모델에 넣고 결과를 비교해 보세요.

테스트 1. 사업기획

한국의 비전공 직장인을 위한 AI 업무 자동화 교육 서비스를 기획하고 있다. 시장의 문제, 타깃 고객, 경쟁 서비스, 차별화 전략, 가격 모델, 초기 90일 실행계획을 작성해줘. 낙관적인 분석과 비관적인 분석을 분리하고, 계획을 중단해야 할 조건도 제시해줘.

확인 항목: 시장을 지나치게 낙관하는가 / 구체적 실행계획이 있는가 / 반대 근거를 제시하는가 / 표와 구조가 읽기 쉬운가 / 실제로 실행 가능한가

테스트 2. 코딩

브라우저에서 단독으로 실행되는 HTML 고객관리 도구를 설계해줘. 고객명, 연락처, 상담 단계, 다음 연락일을 저장하고 검색·수정·CSV 내보내기를 지원해야 한다. 외부 서버와 API는 사용하지 말고, 데이터는 브라우저 로컬 저장소에 보관해줘. 먼저 시스템 설계와 보안 위험을 설명한 뒤 전체 코드를 작성하고 테스트 항목도 제시해줘.

확인 항목: 코드가 실제 실행되는가 / 요구사항을 누락하지 않는가 / 보안 문제를 설명하는가 / 오류 처리가 있는가 / 유지보수가 쉬운가

테스트 3. 보고서

아래 매출 자료를 분석해 대표가 3분 안에 읽을 수 있는 경영 보고서를 작성해줘. 주요 변화, 이상치, 원인 가설, 확인이 필요한 데이터, 다음 달 행동 5가지를 구분해줘. 자료로 확인되지 않는 내용은 사실이 아니라 가설이라고 표시해줘.

확인 항목: 숫자를 정확히 읽는가 / 사실과 추정을 구분하는가 / 중요한 변화만 선별하는가 / 행동 제안이 구체적인가 / 과도한 확신을 피하는가

테스트 4. 글쓰기

폐업을 경험한 1인 사업자가 다시 시작하는 과정을 음식이 천천히 익어가는 과정에 비유한 1,500자 에세이를 작성해줘. 상투적인 위로와 과장된 성공담은 피하고, 담담하지만 마지막에는 작은 희망이 남도록 써줘.

확인 항목: 감정이 자연스러운가 / 비유가 억지스럽지 않은가 / 문체가 끝까지 유지되는가 / 상투적 표현이 적은가 / 수정 없이 사용할 수 있는가

테스트 5. 비판적 검토

다음 사업계획을 지지하려고 하지 말고, 실패 가능성이 높은 이유부터 찾아줘. 숨은 비용, 운영 부담, 고객 획득 난도, 법적 문제, 경쟁사의 대응 가능성을 검토하고, 가장 치명적인 가정 3개를 선정해줘. 그다음에만 계획을 살릴 수 있는 최소 조건을 제안해줘.

확인 항목: 무조건 동의하지 않는가 / 치명적 위험을 우선순위로 두는가 / 근거 없이 단정하지 않는가 / 문제 지적과 해결책을 구분하는가 / 실제 의사결정에 도움이 되는가


최종 결론

세 모델을 한 줄로 정리하면 다음과 같습니다.

  • Claude Opus 4.8: 가장 신중하고 안정적인 협업자
  • Claude Fable 5: 가장 깊고 긴 고난도 작업에 적합한 분석가
  • GPT-5.6 Sol: 코딩·도구 사용·자동화·복합 결과물 제작에 강한 실행자

분야별 최종 추천

분야 추천 모델
종합 추론 Fable 5 (Sol과 근소 차이)
코딩 에이전트 GPT-5.6 Sol
어려운 코드 문제 해결 Fable 5
장문 분석 Fable 5
신중한 판단 Opus 4.8
글쓰기 Opus 4.8
보고서·발표자료 자동 제작 GPT-5.6 Sol
도구·컴퓨터 사용 GPT-5.6 Sol
대규모 장기 프로젝트 Fable 5
비용 대비 성능 GPT-5.6 Terra·Luna
안정적인 범용 사용 Opus 4.8

일반적인 1인 기업가와 실무자에게는 GPT-5.6을 주력으로 쓰고, 중요한 전략 검토나 글쓰기에는 Opus 4.8을 병행하는 조합이 가장 실용적입니다.

연구·복잡한 분석·장기 개발처럼 난도가 매우 높은 작업을 자주 수행한다면 Fable 5의 가치가 커집니다. 반면 단순한 이메일, 요약, 번역까지 최고급 모델로 처리할 필요는 없습니다.

AI 모델은 최고 점수보다 내가 반복해서 수행하는 업무를 얼마나 정확하게 끝내는가를 기준으로 선택해야 합니다.


참고 및 고지

  • 이 글은 2026년 7월 21일 기준 공개 정보를 바탕으로 작성됐습니다. 모델 가격·기능·가용성은 자주 바뀌므로 발행 시점에 재확인을 권장합니다.
  • Fable 5는 2026년 6월 12일 미국 상무부 수출통제 대응으로 접근이 일시 중단됐다가, 통제 해제 후 7월 1일 복구됐습니다.
  • 인용된 벤치마크 상당수는 OpenAI 또는 Anthropic이 직접 선정·공개한 비교 자료입니다.

주요 출처

  • OpenAI, GPT-5.6 공식 발표: https://openai.com/index/gpt-5-6/
  • Anthropic, Claude Fable 5 및 Mythos 5 발표: https://www.anthropic.com/news/claude-fable-5-mythos-5
  • Anthropic, Fable/Mythos 접근 관련 공지: https://www.anthropic.com/news/fable-mythos-access
  • GitHub Changelog, GPT-5.6 Copilot 지원: https://github.blog/changelog/2026-07-09-openais-gpt-5-6-sol-terra-and-luna-are-now-available-in-github-copilot/
  • MarkTechPost, GPT-5.6 3티어 구성 분석: https://www.marktechpost.com/2026/07/09/openai-releases-gpt-5-6-a-three-tier-model-family-with-programmatic-tool-calling/