레이블이 코딩 / 자동화인 게시물을 표시합니다. 모든 게시물 표시
레이블이 코딩 / 자동화인 게시물을 표시합니다. 모든 게시물 표시

2026년 7월 24일 금요일

오픈클로(OpenClaw) 최신 업데이트 총정리 — v2026.6.33 신기능부터 창시자의 OpenAI 합류까지

 

도입부 — 공감 훅

"메신저로 톡 하나만 보냈는데 컴퓨터가 알아서 보고서를 써서 메일로 보냈다고?"

2025년 11월, 오스트리아 개발자 피터 스타인버거(Peter Steinberger)가 "그냥 재미삼아" 만든 개인 사이드 프로젝트가 지금 AI 에이전트 커뮤니티에서 가장 뜨거운 이름이 됐습니다. 바로 오픈클로(OpenClaw)입니다. 출근길 지하철에서 스마트폰으로 "어제 회의록 바탕으로 보고서 초안 써서 내 메일로 보내줘"라고 텔레그램 메시지만 보내면, 컴퓨터가 실제로 파일을 찾고 문서를 작성해서 메일까지 보내주는 방식으로 화제를 모았습니다.

문제는 이 도구가 몇 달 사이 이름도 세 번 바뀌고(Warelay → Clawdbot/Moltbot → OpenClaw), 창시자가 OpenAI에 합류하는 등 워낙 빠르게 변하다 보니 "지금 최신 상태가 정확히 뭔지" 따라가기 어렵다는 점입니다. 오늘은 오픈클로가 무엇인지부터, 2026년 7월 현재 최신 버전에서 뭐가 새로 생겼는지까지 한 번에 정리해드리겠습니다.

본론 — 오픈클로 최신 정보 및 실무 활용 가이드

오픈클로란 무엇인가

오픈클로는 메신저(텔레그램·슬랙·디스코드·왓츠앱 등)를 주된 인터페이스로 삼아, 사용자가 보낸 명령을 받아 여러 단계를 거쳐 실제 작업을 실행하는 오픈소스 자율 AI 에이전트입니다. MIT 라이선스로 공개되어 있고, 자체 LLM을 내장하지 않기 때문에 클로드나 챗GPT 같은 외부 모델 API를 연결하거나, 원한다면 로컬 LLM으로도 구동할 수 있습니다. 즉 오픈클로 자체는 '실행 엔진'이고, 두뇌 역할을 하는 AI 모델은 사용자가 원하는 대로 갈아 끼우는 구조입니다.

최근 반년의 타임라인 — 창시자의 OpenAI 합류까지

  • 2025년 11월 — 'Warelay'라는 이름으로 처음 공개
  • 2026년 1월 27일 — Anthropic으로부터 상표권 관련 문제 제기를 받아 'Moltbot'으로 개명
  • 2026년 1월 30일 — 발음이 입에 잘 붙지 않는다는 이유로 다시 'OpenClaw'로 최종 개명
  • 2026년 2월 15일 — 샘 올트먼이 직접 창시자 피터 스타인버거의 OpenAI 합류를 발표. 스타인버거는 '차세대 개인 에이전트' 개발을 이끌게 됐고, 오픈클로 자체는 재단 형태로 독립적인 오픈소스 프로젝트로 유지되며 OpenAI의 지원을 계속 받는 구조로 정리됐습니다.

한 사람의 사이드 프로젝트가 석 달 만에 대형 AI 기업의 관심을 끌 만큼 커진 셈인데, GitHub 스타 수도 2월 중순 18만 개에서 3월에는 28만 개를 돌파하며 빠르게 성장했습니다.

기능 진화 — '실험적 도구'에서 '에이전트 운영체제'로

2026년 3월 공개된 대규모 업데이트(v2026.3.7)는 오픈클로가 실험적 프레임워크에서 '에이전트 운영체제(Agent OS)'로 전환하는 분기점으로 평가받았습니다. 핵심은 GPT-5.4 네이티브 지원과 메모리 핫스와핑 기능으로, 자체 벤치마크(OOLONG) 테스트에서 74.8점을 기록해 같은 테스트의 Claude Code(70.3점)를 앞선다는 결과가 나오기도 했습니다. 다만 이런 급성장에는 그늘도 있었는데, 커뮤니티 스킬 마켓플레이스인 ClawHub에서 악성 스킬 400여 개가 발견되는 보안 사고도 함께 불거졌습니다. 이후 4월 업데이트(v2026.4.2)는 신기능 추가보다 내부 안정화와 보안 강화에 집중한 버전으로, 기본 보안 설정이 더 보수적으로 바뀌었습니다.

2026년 7월 최신 버전 — 원격 코딩 세션과 GPT-5.6 지원

현재 최신 정식 버전은 v2026.6.33(7월 21일 배포)이며, 2026.7.2 베타 버전도 함께 공개되어 있습니다. 이번 업데이트의 핵심은 다음과 같습니다.

  • 원격 코딩 세션 — Control UI 세션을 클라우드 워커에서 실행하고, Codex나 Claude 세션을 소유 호스트의 터미널에서 직접 열 수 있으며, OpenCode·Pi 세션도 터미널에서 바로 재개할 수 있습니다.
  • openclaw attach 명령 신설 — 기존 게이트웨이 세션에 외부 하네스를 붙여, Claude Code에 특정 세션에 대한 임시 접근 권한을 부여하거나 Codex 스타일 워크플로우를 재개·점검할 수 있게 됐습니다.
  • GPT-5.6 모델 패밀리 지원 — 카탈로그·기능·런타임 선택 전반에서 GPT-5.6을 인식하도록 업데이트됐습니다.
  • 모바일·헤드리스 리눅스 노드 자동화 — 데스크톱뿐 아니라 모바일 환경과 화면 없는 리눅스 서버에서도 네이티브 자동화가 가능해졌습니다.
  • 메신저 통합 강화 — 텔레그램은 실시간 진행 상황·사진/문서 전송·재시도 처리가, 슬랙은 스레드·카드·중복 방지가, 디스코드는 답장·음성 세션·재연결 안정성이 각각 개선됐습니다.

실무자가 알아둘 것 — 비용과 업데이트 방식

오픈클로 자체는 무료 오픈소스이지만, 실제 비용은 연결하는 LLM API 사용료에서 발생합니다. 프롬프트 최적화 없이 API를 그대로 쓰면 예상보다 비용이 많이 나올 수 있어 주의가 필요하고, 무료로 체험하고 싶다면 구글 AI 스튜디오에서 제미나이 모델의 무료 API 키를 발급받아 연동하는 방법도 있습니다. 보안을 위해 별도 서버를 호스팅하면 월 5달러 정도, 맥 미니 같은 전용 기기를 따로 마련하면 추가 비용이 발생할 수 있습니다.

또한 오픈클로는 아직 1.0 정식 출시 전 단계로 한 달에 한두 번씩 마이너 업데이트가 나올 만큼 변화가 빠릅니다. 업데이트 전에는 설정 파일과 인증 정보, 워크스페이스를 미리 백업해두고, openclaw update 명령으로 업데이트한 뒤 openclaw doctor로 설정을 점검하는 절차를 따르는 것이 권장됩니다.

지금 바로 확인하는 법 — 실전 활용 테스트 5가지

오픈클로를 도입하기 전, 메신저로 아래 5가지 명령을 직접 보내보세요.

① 문서 자동 작성 및 발송 테스트

어제 [회의명] 회의록을 바탕으로 보고서 초안을 써서 
내 이메일로 보내줘.

→ 결과: 자료를 어디서 찾아오는지, 최종 산출물의 완성도가 사람 손질 없이 쓸 만한 수준인지 확인하세요.

② 원격 코딩 세션 테스트

(연결된 저장소에서) 최근 이슈로 등록된 버그를 확인하고, 
Codex 세션을 열어서 수정 작업을 진행해줘.

→ 결과: 클라우드 워커에서 원격으로 작업을 맡기고 결과를 받는 흐름이 실제로 매끄러운지 점검하세요.

③ 메신저 연동 안정성 테스트

(슬랙/디스코드에서) 진행 중인 작업의 실시간 진행 상황을 
스레드로 계속 업데이트해줘.

→ 결과: 긴 작업 중 연결이 끊기거나 중복 메시지가 발생하지 않는지 확인하세요.

④ 외부 LLM 전환 비용 테스트

같은 작업을 (클로드 API와 로컬 LLM 각각으로) 실행해서, 
결과 품질과 소요 비용 차이를 비교해줘.

→ 결과: 어떤 모델 조합이 내 업무에 가장 비용 효율적인지 직접 확인하세요.

⑤ 보안 설정 점검

현재 설정에서 외부 스킬이나 플러그인이 
어떤 권한까지 접근할 수 있는지 정리해줘.

→ 결과: ClawHub 같은 외부 마켓플레이스 스킬을 쓰기 전, 권한 범위를 먼저 파악하는 습관이 중요합니다.

마무리 — 즉시 실행 CTA

오픈클로는 한 사람의 사이드 프로젝트에서 출발해 반년 만에 '에이전트 운영체제'를 표방할 만큼 빠르게 성장했고, 창시자가 OpenAI에 합류한 뒤에도 독립 오픈소스 프로젝트로 계속 진화하고 있습니다. 다만 성장 속도만큼 보안 이슈도 함께 불거졌던 만큼, 도입 전 권한 범위와 비용 구조부터 꼼꼼히 확인하는 것이 중요합니다.

지금 바로 ① 문서 자동 작성 및 발송 테스트부터 메신저로 보내보세요. 실제 업무 자료로 직접 확인한 결과가, 어떤 소개 글보다 정확한 판단 기준이 되어줄 것입니다.

2026년 7월 19일 일요일

Claude Opus 4.8·Fable 5·GPT-5.6 성능 비교: 어떤 AI가 가장 좋을까?

Claude Opus 4.8 · Fable 5 · GPT-5.6 성능 비교: 어떤 AI가 가장 좋을까?

최근 생성형 AI 시장에서는 단순히 "어느 모델이 벤치마크 점수가 가장 높은가"보다, 내가 실제로 하는 작업에서 어느 모델이 더 안정적이고 경제적인가가 중요해졌습니다.

이 글에서 비교하는 세 모델은 다음과 같습니다.

모델 출시일 제조사
Claude Opus 4.8 2026년 5월 28일 Anthropic
Claude Fable 5 2026년 6월 9일 Anthropic
GPT-5.6 (Sol/Terra/Luna) 2026년 7월 9일 OpenAI

GPT-5.6은 하나의 모델이 아니라 세 가지 등급으로 구성됩니다.

  • GPT-5.6 Sol: 최고 성능 모델
  • GPT-5.6 Terra: 성능과 비용의 균형형
  • GPT-5.6 Luna: 속도와 비용 효율형

OpenAI는 "숫자는 세대를 뜻하고, Sol·Terra·Luna는 각자의 속도로 발전하는 지속적인 성능 등급"이라고 설명합니다. 따라서 Fable 5나 Opus 4.8과 최고 성능을 비교할 때는 주로 GPT-5.6 Sol을 기준으로 봐야 합니다.

읽기 전 주의사항 이 글에 인용된 벤치마크 수치는 상당 부분 각 회사가 직접 선택해 공개한 비교 자료입니다. 자사에 유리한 항목이 선별될 수밖에 없으므로, 절대적인 순위표가 아니라 "대략적인 성향 지도"로 읽는 것이 안전합니다. 또한 같은 모델이라도 추론 강도(effort/reasoning) 설정에 따라 점수와 비용이 크게 달라집니다.


세 모델의 핵심 차이 한눈에 보기

비교 항목 Claude Opus 4.8 Claude Fable 5 GPT-5.6 Sol
모델 성격 안정적인 고성능 범용 모델 Anthropic 최상위(Mythos급) 모델 OpenAI 최고 성능 범용·에이전트 모델
가장 강한 분야 판단력, 장문 작성, 신중한 검토 복잡한 분석, 장기 작업, 지식 업무 코딩 에이전트, 도구 사용, 업무 자동화
코딩 성능 매우 우수 (특히 결함 탐지) 최상위권 코딩 에이전트 평가에서 최고
업무 문서 자연스럽고 신중함 깊고 정교한 결과 구조화·도구 연계에 강함
긴 작업 수행 안정적 작업이 길고 복잡할수록 격차 확대 프로그램형 도구 호출에 강함
답변 성향 신중하고 비판적 깊고 집요하게 분석 빠르게 구조화하고 실행
컨텍스트 100만 토큰 100만 토큰 대용량 (272K 초과 시 요금 가중)
안전 제한 비교적 엄격 민감 요청은 Opus 4.8로 전환 분야별 강화된 안전 정책
API 가격(100만 토큰) $5 / $25 $10 / $50 $5 / $30
추천 사용자 기획자·작가·의사결정 검토 전문 분석·연구·대형 프로젝트 코딩·자동화·멀티도구 사용자

1. 전체 지능과 추론 성능

전체 지능을 하나의 숫자로 결정하기는 어렵습니다. 벤치마크마다 측정하는 능력이 다르기 때문입니다.

독립 평가기관 Artificial Analysis의 Intelligence Index(각 모델 최대 추론 설정 기준)에서는 Fable 5와 GPT-5.6 Sol이 1점 내외 차이로 사실상 동급이며, 그 아래에 Opus 4.8과 GPT-5.6 Terra·Luna가 위치합니다.

모델 대략적 위치
Claude Fable 5 (max) 최상위 (약 60)
GPT-5.6 Sol (max) 최상위 (약 59)
Claude Opus 4.8 상위 (약 56)
GPT-5.6 Terra 중상위 (약 55)
GPT-5.6 Luna 중위 (약 51)

주목할 점은 비용 대비 효율입니다. Artificial Analysis에 따르면 Sol은 Fable 5보다 1점 낮은 점수를 작업당 약 3분의 1 비용으로 달성했습니다.

반대로 업무 수행형 평가에서는 순위가 달라집니다. OpenAI가 공개한 경영 컨설팅 업무 평가에서는 GPT-5.6 Sol이 43.2%, Fable 5가 35.5%, Opus 4.8이 31.6%를 기록했습니다. 장기 전문 업무를 평가하는 Agents' Last Exam에서도 Sol이 53.6으로 최고치를 기록했다고 발표했습니다. (단, 이 두 수치는 모두 OpenAI 자체 발표입니다.)

정리하면 이렇게 해석하는 것이 정확합니다.

  • 순수 종합 지능과 복잡한 추론: Fable 5가 근소 우위
  • 실제 업무를 단계별로 끝내는 능력: GPT-5.6 Sol이 강함
  • 비용까지 함께 고려한 지능: GPT-5.6 Sol이 유리
  • 안정적인 판단과 장문 협업: Opus 4.8이 여전히 경쟁력 있음

2. 코딩 성능 비교

코딩은 GPT-5.6이 가장 강하게 내세우는 영역입니다.

GPT-5.6 Sol은 Artificial Analysis Coding Agent Index에서 80점을 기록해 Fable 5보다 2.8점 높았습니다. OpenAI는 이 과정에서 출력 토큰과 수행 시간이 절반 이하, 예상 비용은 약 3분의 1 수준이었다고 설명합니다.

다만 벤치마크를 하나 더 보면 결론이 뒤집힙니다. 실제 저장소 이슈를 해결하는 SWE-Bench Pro에서는 Sol이 64.6%로, Mythos급 모델(약 80%)에 15%p가량 뒤집니다. 즉 "에이전트로서 작업을 효율적으로 끝내는 능력"과 "어려운 코드 문제 자체를 푸는 능력"은 다르게 측정됩니다.

GPT-5.6 Sol이 적합한 경우

  • Codex로 실제 프로젝트를 개발할 때
  • 여러 파일과 도구를 동시에 다룰 때
  • 속도와 비용까지 중요할 때
  • 코드 작성부터 테스트·배포까지 맡길 때

Fable 5가 적합한 경우

  • 복잡한 앱 구조를 처음부터 설계할 때
  • 대규모 리팩터링 계획을 만들 때
  • 난도 높은 버그를 끝까지 파고들어야 할 때
  • 장시간 이어지는 개발 작업을 맡길 때

Opus 4.8이 적합한 경우

  • 중요한 코드 변경을 신중하게 검토할 때
  • 설계안의 허점을 찾을 때
  • 개발 계획과 위험성을 비판적으로 평가할 때

Anthropic은 Opus 4.8이 큰 변경을 하기 전에 문제를 탐색하고, 잘못된 계획을 지적하며, 자신의 실수를 더 잘 발견하도록 개선됐다고 설명합니다. 특히 코드 결함 탐지 능력이 이전 모델 대비 약 4배 향상됐다고 밝혔는데, 코드 리뷰나 보안 감사 파이프라인에서는 이 차이가 실질적입니다.

코딩 종합 판단

에이전트형 개발 워크플로 전체를 기준으로 하면 현재 GPT-5.6 Sol이 가장 실용적입니다. 다만 순수한 문제 해결 난도와 복잡한 설계에서는 Fable 5가 앞서는 평가도 있으므로, "코딩 1위"를 단정하기보다 어떤 코딩 작업인지로 나눠 보는 편이 정확합니다.


3. 기획·보고서·시장조사 성능

문서와 기획 업무에서는 단순 정확도보다 다음 요소가 중요합니다.

  • 문제를 올바르게 정의하는가
  • 빠진 조건을 발견하는가
  • 반대 의견을 검토하는가
  • 장문의 논리를 유지하는가
  • 출처와 사실을 구분하는가

Claude Opus 4.8

사용자 의견에 무조건 동의하기보다 계획의 문제점을 지적하고, 논리가 약한 부분에서 반론을 제시하는 성향이 강합니다.

적합한 업무: 사업계획서 검토, 전략 보고서 비판, 계약·정책 문서 분석, 장문 원고 작성, 의사결정 위험요소 검토.

Claude Fable 5

Anthropic은 Fable 5에 대해 **"작업이 길고 복잡할수록 다른 자사 모델과의 격차가 커진다"**고 설명했습니다. 소프트웨어 공학뿐 아니라 지식 업무, 시각 자료, 과학 연구에서도 일반 공개된 자사 모델 중 가장 강력하다고 밝혔습니다.

적합한 업무: 여러 문서를 종합한 분석, 장기 리서치, 복잡한 데이터 관계 파악, 전략 시나리오 작성, 대규모 프로젝트 계획.

GPT-5.6 Sol

분석 결과를 문서에만 머물게 하지 않고, 프로그램과 도구를 사용해 실제 산출물로 만드는 데 강합니다. OpenAI는 GPT-5.6 Sol이 발표자료·문서·스프레드시트 품질을 개선해 완전히 편집 가능한 프레젠테이션을 처음부터 생성할 수 있다고 설명합니다.

또한 API에는 모델이 직접 작성한 코드로 도구 호출을 조율하는 Programmatic Tool Calling(격리된 V8 런타임, 네트워크 차단)과, 복수 하위 에이전트를 병렬 실행하는 멀티에이전트 기능이 도입됐습니다.

종합 판단

  • 가장 깊은 분석: Fable 5
  • 가장 신중한 비판과 판단: Opus 4.8
  • 조사부터 결과물 제작까지: GPT-5.6 Sol

4. 글쓰기와 창작 능력

글쓰기 성능은 벤치마크보다 사용자의 취향에 크게 좌우됩니다. 아래는 수치가 아니라 일반적으로 보고되는 성향입니다.

Opus 4.8 — 긴 문맥 유지, 자연스러운 문장 연결, 과도하게 요약하지 않는 설명, 섬세한 감정 표현, 문체와 톤 유지. 소설·에세이·칼럼·브랜드 스토리처럼 완성된 글의 질이 중요한 작업에 적합합니다.

Fable 5 — Opus의 글쓰기 성향을 유지하면서 더 복잡한 구조와 더 긴 프로젝트를 다룹니다. 장편 원고, 세계관 관리, 여러 문서의 문체 통합, 고난도 구조 재설계에 유리합니다. 다만 짧은 게시물이나 카피에는 비용 대비 과합니다.

GPT-5.6 — 글 자체의 감성보다 목적과 형식에 맞는 결과물을 빠르게 만드는 데 강합니다. SEO 원고, 보고서, 광고 문구, 이메일, 콘텐츠 캘린더, 표·체크리스트, 플랫폼별 문구 변환에 적합합니다.

추천

  • 감성적이고 자연스러운 장문: Opus 4.8
  • 복잡한 장편 프로젝트: Fable 5
  • SEO·마케팅·실무 문서: GPT-5.6

5. 에이전트와 컴퓨터 작업 능력

2026년의 AI 경쟁은 답변 품질보다 실제로 일을 끝내는 능력으로 이동하고 있습니다.

GPT-5.6

프로그램을 작성해 도구 사용 과정을 조정하고, 중간 결과를 확인하고, 다음 행동을 결정할 수 있습니다. 하위 에이전트 4개를 병렬 실행하는 ultra 모드는 Terminal-Bench 2.1 점수를 88.8%에서 91.9%로 끌어올렸다고 발표됐습니다.

Fable 5

장기 에이전트 작업에서 뛰어난 능력을 보이지만, 안전상 민감한 요청에서는 응답이 Opus 4.8로 전환됩니다. Anthropic은 이 안전장치가 평균적으로 전체 세션의 5% 미만에서 작동하며, 빠른 출시를 위해 보수적으로 설정했기 때문에 무해한 요청도 가끔 걸린다고 밝혔습니다.

Opus 4.8

에이전트가 잘못된 방향으로 성급하게 실행하는 문제를 줄이는 데 강점이 있습니다. 웹 에이전트 평가인 Online-Mind2Web에서 84%를 기록했고, Legal Agent Benchmark에서는 해당 벤치마크 최초로 10% 이상 달성률을 기록했습니다.

추천

  • 다양한 도구를 연결해 결과를 완성: GPT-5.6
  • 장시간 복잡한 작업: Fable 5
  • 실수 방지와 신중한 실행: Opus 4.8

6. 속도와 비용 효율

API를 사용하는 기업과 개발자에게는 최고 점수보다 비용이 중요합니다.

100만 토큰 기준 공식 가격

모델 입력 출력
Claude Fable 5 $10 $50
Claude Opus 4.8 (일반) $5 $25
Claude Opus 4.8 (빠른 모드) $10 $50
GPT-5.6 Sol $5 $30
GPT-5.6 Terra $2.50 $15
GPT-5.6 Luna $1 $6

꼭 알아둘 과금 조건

  • Opus 4.8의 빠른 모드는 일반 모드보다 약 2.5배 빠르며, 이전 세대 빠른 모드보다 3배 저렴해졌습니다.
  • GPT-5.6부터는 캐시 쓰기가 일반 입력 요금의 1.25배로 과금됩니다. 캐시 읽기 90% 할인은 유지됩니다.
  • GPT-5.6은 약 27만 2천 토큰을 넘는 프롬프트에 대해 입력 요금이 2배로 적용됩니다. 대형 코드베이스를 통째로 넣을 때 중요합니다.
  • Fable 5는 트래픽에 30일 데이터 보존 정책이 적용됩니다(학습에는 사용하지 않는다고 밝힘). 민감 데이터를 다루는 조직은 확인이 필요합니다.

OpenAI는 Terra와 Luna가 일부 평가에서 Fable 5를 앞서면서 비용은 훨씬 낮다고 설명하지만, 이는 OpenAI가 선택해 공개한 비교라는 점을 감안해야 합니다.

비용 효율 추천

  • 최고 성능이 반드시 필요: GPT-5.6 Sol 또는 Fable 5
  • 일상적인 고난도 업무: GPT-5.6 Terra
  • 대량 처리와 반복 자동화: GPT-5.6 Luna
  • 신중한 장문 분석과 개발 검토: Opus 4.8

실제 사용자 유형별 추천

1인 기업가와 기획자 → GPT-5.6 Sol 또는 Terra 시장조사, 보고서, 표, 문서, 자동화까지 하나의 작업 흐름에서 처리하기 좋습니다.

개발자 → GPT-5.6 Sol Codex와 함께 코드 작성, 테스트, 수정, 터미널 사용, 배포를 연결하기 좋습니다. 대규모 앱 설계와 복잡한 리팩터링에서는 Fable 5를 보조로 함께 쓸 가치가 있습니다.

작가와 콘텐츠 제작자 → Claude Opus 4.8 문맥 유지, 감정선, 비판적 편집이 중요할 때 적합합니다. 장편이나 대규모 세계관 프로젝트라면 Fable 5가 유리할 수 있습니다.

연구자와 전문 분석가 → Claude Fable 5 긴 자료를 읽고 복잡한 관계를 파악하거나, 여러 단계의 가설을 검토하는 작업에 적합합니다.

AI 자동화 구축자 → GPT-5.6 도구 호출, 프로그램 실행, 하위 에이전트 분배, 구조화된 결과 생성에 유리합니다.

중요한 의사결정을 검토하는 사용자 → Claude Opus 4.8 무조건 동의하는 답보다 계획의 위험과 논리적 허점을 지적하는 역할에 강합니다.


바로 테스트할 수 있는 비교 프롬프트 5가지

벤치마크보다 정확한 판단 기준은 내 업무로 직접 돌려보는 것입니다. 같은 프롬프트를 세 모델에 넣고 결과를 비교해 보세요.

테스트 1. 사업기획

한국의 비전공 직장인을 위한 AI 업무 자동화 교육 서비스를 기획하고 있다. 시장의 문제, 타깃 고객, 경쟁 서비스, 차별화 전략, 가격 모델, 초기 90일 실행계획을 작성해줘. 낙관적인 분석과 비관적인 분석을 분리하고, 계획을 중단해야 할 조건도 제시해줘.

확인 항목: 시장을 지나치게 낙관하는가 / 구체적 실행계획이 있는가 / 반대 근거를 제시하는가 / 표와 구조가 읽기 쉬운가 / 실제로 실행 가능한가

테스트 2. 코딩

브라우저에서 단독으로 실행되는 HTML 고객관리 도구를 설계해줘. 고객명, 연락처, 상담 단계, 다음 연락일을 저장하고 검색·수정·CSV 내보내기를 지원해야 한다. 외부 서버와 API는 사용하지 말고, 데이터는 브라우저 로컬 저장소에 보관해줘. 먼저 시스템 설계와 보안 위험을 설명한 뒤 전체 코드를 작성하고 테스트 항목도 제시해줘.

확인 항목: 코드가 실제 실행되는가 / 요구사항을 누락하지 않는가 / 보안 문제를 설명하는가 / 오류 처리가 있는가 / 유지보수가 쉬운가

테스트 3. 보고서

아래 매출 자료를 분석해 대표가 3분 안에 읽을 수 있는 경영 보고서를 작성해줘. 주요 변화, 이상치, 원인 가설, 확인이 필요한 데이터, 다음 달 행동 5가지를 구분해줘. 자료로 확인되지 않는 내용은 사실이 아니라 가설이라고 표시해줘.

확인 항목: 숫자를 정확히 읽는가 / 사실과 추정을 구분하는가 / 중요한 변화만 선별하는가 / 행동 제안이 구체적인가 / 과도한 확신을 피하는가

테스트 4. 글쓰기

폐업을 경험한 1인 사업자가 다시 시작하는 과정을 음식이 천천히 익어가는 과정에 비유한 1,500자 에세이를 작성해줘. 상투적인 위로와 과장된 성공담은 피하고, 담담하지만 마지막에는 작은 희망이 남도록 써줘.

확인 항목: 감정이 자연스러운가 / 비유가 억지스럽지 않은가 / 문체가 끝까지 유지되는가 / 상투적 표현이 적은가 / 수정 없이 사용할 수 있는가

테스트 5. 비판적 검토

다음 사업계획을 지지하려고 하지 말고, 실패 가능성이 높은 이유부터 찾아줘. 숨은 비용, 운영 부담, 고객 획득 난도, 법적 문제, 경쟁사의 대응 가능성을 검토하고, 가장 치명적인 가정 3개를 선정해줘. 그다음에만 계획을 살릴 수 있는 최소 조건을 제안해줘.

확인 항목: 무조건 동의하지 않는가 / 치명적 위험을 우선순위로 두는가 / 근거 없이 단정하지 않는가 / 문제 지적과 해결책을 구분하는가 / 실제 의사결정에 도움이 되는가


최종 결론

세 모델을 한 줄로 정리하면 다음과 같습니다.

  • Claude Opus 4.8: 가장 신중하고 안정적인 협업자
  • Claude Fable 5: 가장 깊고 긴 고난도 작업에 적합한 분석가
  • GPT-5.6 Sol: 코딩·도구 사용·자동화·복합 결과물 제작에 강한 실행자

분야별 최종 추천

분야 추천 모델
종합 추론 Fable 5 (Sol과 근소 차이)
코딩 에이전트 GPT-5.6 Sol
어려운 코드 문제 해결 Fable 5
장문 분석 Fable 5
신중한 판단 Opus 4.8
글쓰기 Opus 4.8
보고서·발표자료 자동 제작 GPT-5.6 Sol
도구·컴퓨터 사용 GPT-5.6 Sol
대규모 장기 프로젝트 Fable 5
비용 대비 성능 GPT-5.6 Terra·Luna
안정적인 범용 사용 Opus 4.8

일반적인 1인 기업가와 실무자에게는 GPT-5.6을 주력으로 쓰고, 중요한 전략 검토나 글쓰기에는 Opus 4.8을 병행하는 조합이 가장 실용적입니다.

연구·복잡한 분석·장기 개발처럼 난도가 매우 높은 작업을 자주 수행한다면 Fable 5의 가치가 커집니다. 반면 단순한 이메일, 요약, 번역까지 최고급 모델로 처리할 필요는 없습니다.

AI 모델은 최고 점수보다 내가 반복해서 수행하는 업무를 얼마나 정확하게 끝내는가를 기준으로 선택해야 합니다.


참고 및 고지

  • 이 글은 2026년 7월 21일 기준 공개 정보를 바탕으로 작성됐습니다. 모델 가격·기능·가용성은 자주 바뀌므로 발행 시점에 재확인을 권장합니다.
  • Fable 5는 2026년 6월 12일 미국 상무부 수출통제 대응으로 접근이 일시 중단됐다가, 통제 해제 후 7월 1일 복구됐습니다.
  • 인용된 벤치마크 상당수는 OpenAI 또는 Anthropic이 직접 선정·공개한 비교 자료입니다.

주요 출처

  • OpenAI, GPT-5.6 공식 발표: https://openai.com/index/gpt-5-6/
  • Anthropic, Claude Fable 5 및 Mythos 5 발표: https://www.anthropic.com/news/claude-fable-5-mythos-5
  • Anthropic, Fable/Mythos 접근 관련 공지: https://www.anthropic.com/news/fable-mythos-access
  • GitHub Changelog, GPT-5.6 Copilot 지원: https://github.blog/changelog/2026-07-09-openais-gpt-5-6-sol-terra-and-luna-are-now-available-in-github-copilot/
  • MarkTechPost, GPT-5.6 3티어 구성 분석: https://www.marktechpost.com/2026/07/09/openai-releases-gpt-5-6-a-three-tier-model-family-with-programmatic-tool-calling/

2026년 7월 12일 일요일

GPT-5.6 Sol·Terra·Luna 차이점 총정리|기능·성능·가격·용도 비교

 2026년 7월 11일 현재, GPT-5.6은 하나의 단일 모델이 아니라 다음 세 가지 성능 등급으로 구성됩니다.

Sol = 최고 성능
Terra = 성능·속도·비용 균형
Luna = 최고 속도·최저 비용

여기서 중요한 점은 Sol·Terra·Luna가 추론 강도 설정이 아니라 서로 다른 모델이라는 것입니다. GPT-5.6이라는 숫자는 세대를, Sol·Terra·Luna는 장기적으로 유지될 성능 등급을 의미합니다.


1. 핵심 비교

구분GPT-5.6 SolGPT-5.6 TerraGPT-5.6 Luna
포지션플래그십균형형·실무형고속·대량처리형
우선순위정확도·완성도가성비·속도·성능속도·비용
이전 계열에 비유일반 플래그십 모델Mini급 포지션Nano급 포지션
모델 자체 추론 능력최고높음상대적으로 낮음
속도빠름빠름세 모델 중 가장 빠름
복잡한 문제가장 적합상당히 강함단순·명확한 문제에 적합
장기 작업가장 적합일반적인 장기 작업 가능복잡한 장기 작업에는 불리
대량 자동화비용이 높음균형적가장 적합
API 입력 가격$5 / 100만 토큰$2.50 / 100만 토큰$1 / 100만 토큰
API 출력 가격$30 / 100만 토큰$15 / 100만 토큰$6 / 100만 토큰
모델 IDgpt-5.6-solgpt-5.6-terragpt-5.6-luna

Terra는 Sol 가격의 절반, Luna는 Sol 가격의 20%입니다. OpenAI는 Terra를 이전 GPT-5.5와 경쟁할 수 있는 성능의 균형형 모델로, Luna를 가장 빠르고 경제적인 모델로 설명합니다.


2. GPT-5.6 Sol

성격

Sol은 GPT-5.6 제품군의 최상위 플래그십 모델입니다.

복잡한 요청을 단순히 답변하는 수준이 아니라 다음과 같은 작업을 끝까지 설계하고 다듬는 데 초점이 있습니다.

  • 복잡한 코딩과 시스템 설계
  • 여러 파일에 걸친 디버깅과 리팩터링
  • 전문 연구와 자료 비교
  • 장문의 문서·보고서 분석
  • 컴퓨터 조작 및 브라우저 작업
  • 프레젠테이션·웹·앱 디자인
  • 과학·수학·사이버 보안
  • 모호한 요구사항을 구조화하는 작업

OpenAI는 특히 GPT-5.6에서 디자인 판단력과 컴퓨터 사용 능력이 크게 향상되었다고 설명합니다. 단순히 코드를 작성하는 것뿐 아니라 실제 렌더링 결과를 확인하고 레이아웃이나 기능 문제를 수정하는 방향입니다.

Sol이 유리한 작업

코딩

  • 앱 전체 구조 설계
  • 음원 분석·보컬 튜닝 프로그램 개발
  • 여러 모듈에 걸친 버그 추적
  • 데이터베이스와 API 설계
  • 보안·권한 관련 코드
  • 기존 프로젝트 전체 리팩터링
  • 실패 원인을 알기 어려운 오류 해결

창작·기획

  • 앨범 전체 콘셉트와 트랙 서사 설계
  • 뮤직비디오 장면 연결
  • 상업성과 작품성을 동시에 고려한 전략
  • 긴 가사의 논리·감정선 재구성
  • 서로 다른 여러 자료를 통합한 보고서

문서·리서치

  • 계약서나 정책 여러 개 비교
  • 최근 AI 음악 정책 분석
  • 수익화 구조와 플랫폼별 대응 전략
  • 긴 PDF·스프레드시트·프레젠테이션 분석

단점

  • 세 모델 중 비용이 가장 높습니다.
  • 같은 추론 수준이라면 단순 작업에는 과할 수 있습니다.
  • 복잡하게 생각할 필요가 없는 반복 작업에 사용하면 비용 효율이 낮습니다.

3. GPT-5.6 Terra

성격

Terra는 일상적인 전문 작업을 위한 주력 모델, 즉 ‘워크호스’에 가깝습니다.

Sol보다 저렴하면서 상당수 코딩·지식 작업에서는 Sol과 비교적 가까운 성능을 냅니다. OpenAI는 Terra가 이전 세대의 Mini 모델과 대략 대응하는 위치라고 설명하지만, 이것은 단순한 저성능 모델이라는 뜻이 아니라 GPT-5.6 세대의 중간급 모델이라는 의미입니다.

Terra가 유리한 작업

  • 일반적인 코드 작성과 수정
  • 웹사이트 기능 추가
  • 테스트 코드 생성
  • 표준적인 버그 수정
  • 문서 요약과 분류
  • 가사 교정 및 형식 변환
  • 여러 버전의 콘텐츠 생성
  • 이메일·상품 설명·게시물 작성
  • 데이터 정리와 표 변환
  • 일반적인 웹 리서치
  • 정해진 규칙을 따르는 에이전트 작업

Terra의 강점

Terra는 특히 비용 대비 성능이 좋습니다.

일부 코딩 평가에서는 Sol과 차이가 작습니다.

평가SolTerra차이
SWE-Bench Pro64.6%63.4%1.2%p
Terminal-Bench 2.188.8%87.4%1.4%p
Agents’ Last Exam52.7%50.4%2.3%p
GPQA Diamond94.6%92.9%1.7%p

따라서 일반적인 Codex 개발 작업은 Terra로 시작하고, 막히거나 설계 난도가 높아지면 Sol로 전환하는 방식이 효율적입니다.

Terra가 Sol보다 불리한 영역

차이가 커지는 영역은 다음과 같습니다.

  • 컴퓨터를 직접 조작하는 복잡한 작업
  • 매우 어려운 수학·과학 추론
  • 복잡한 시각 디자인 판단
  • 여러 단계에 걸친 장기 에이전트 작업
  • 모호한 요구사항에서 의도를 추론해야 하는 작업
  • 최종 결과물의 세밀한 완성도

예를 들어 OSWorld 2.0 컴퓨터 사용 평가에서는 Sol 62.6%, Terra 50.2%로 차이가 비교적 크게 나타났습니다.


4. GPT-5.6 Luna

성격

Luna는 속도와 비용을 최우선으로 하는 모델입니다.

이전 계열의 Nano 모델과 비슷한 위치이며, 명확하고 반복 가능한 작업을 대량으로 처리하는 데 적합합니다. 모델 자체의 지능은 Sol과 Terra보다 낮지만, 모든 단순 작업에서 결과가 나쁘다는 뜻은 아닙니다. 요청이 명확하고 출력 규칙이 구체적일수록 Luna의 효율이 높아집니다.

Luna가 유리한 작업

  • 데이터 분류
  • 태그·키워드 생성
  • 짧은 요약
  • 맞춤법과 형식 정리
  • 제목 후보 대량 생성
  • 정해진 템플릿 채우기
  • 메타데이터 생성
  • 단순 번역
  • 반복적인 코드 수정
  • 보일러플레이트 코드
  • 로그 분석과 라벨링
  • 대규모 고객 문의 1차 분류
  • 단순한 에이전트의 서브 작업

음악 작업 예시

Luna에 적합한 작업은 다음과 같습니다.

  • DistroKid 가사에서 섹션 태그 제거
  • 가사의 영어 첫 글자 대문자 규칙 적용
  • 곡 제목·장르·발매일을 표로 변환
  • 쇼츠 해시태그 20세트 생성
  • 여러 곡의 메타데이터 일괄 정리
  • 동일한 양식으로 Spotify 피치 초안 생성
  • 가사에서 금지 단어가 있는지 검사

반면 다음 작업에는 Sol이나 Terra가 더 적합합니다.

  • 음식과 감정의 은유를 새롭게 설계
  • 가사 전체의 감정선 재구성
  • 히트곡 구조와 반복 유지율까지 고려
  • 앨범 전체 서사를 통합
  • 여러 플랫폼 정책을 근거로 유통 전략 판단

Luna의 한계

Luna는 긴 문서를 입력할 수는 있지만, 매우 긴 컨텍스트에서 중요한 정보를 정확히 찾아 연결하는 능력은 Sol·Terra보다 떨어집니다.

512K~1M 토큰 장문 검색 평가에서 결과는 다음과 같습니다.

모델MRCR 장문 검색
Sol73.8%
Terra72.5%
Luna41.3%

즉, 세 모델 모두 100만 토큰급 입력을 받을 수 있지만, 입력 가능 길이와 실제로 내용을 잘 활용하는 능력은 별개입니다.


5. 세 모델이 공통으로 지원하는 기능

Sol·Terra·Luna는 모델 크기와 성능은 다르지만 기본 기술 사양은 거의 같습니다.

사양공통 지원
컨텍스트 윈도1,050,000토큰
최대 출력128,000토큰
지식 기준일2026년 2월 16일
입력텍스트·이미지
출력텍스트
스트리밍지원
함수 호출지원
구조화 출력지원
이미지 이해지원
웹 검색지원
파일 검색지원
컴퓨터 사용지원
Responses API지원
Chat Completions API지원
Batch API지원

즉, Luna도 이미지와 긴 문서를 입력받고 도구를 사용할 수 있습니다. 차이는 ‘기능이 있느냐’보다 그 기능을 얼마나 정확하고 안정적으로 수행하느냐에 있습니다.

단, 세 모델은 기본적으로 텍스트 출력 모델입니다. 음성 합성이나 이미지 생성 자체는 별도의 음성·이미지 모델 또는 도구를 호출하는 구조입니다.


6. 실제 성능 차이가 나타나는 영역

상대적으로 차이가 작은 영역

다음과 같은 영역은 Terra 또는 Luna도 Sol에 상당히 근접할 수 있습니다.

  • 명확한 코딩 문제
  • 일반 상식·전문 지식 문제
  • 정형화된 문서 작성
  • 간단한 도구 호출
  • 규칙이 명확한 반복 작업
평가SolTerraLuna
Agents’ Last Exam52.7%50.4%50.3%
SWE-Bench Pro64.6%63.4%62.7%
Terminal-Bench 2.188.8%87.4%84.7%
GPQA Diamond94.6%92.9%92.3%

차이가 커지는 영역

평가SolTerraLuna
OSWorld 2.0 컴퓨터 사용62.6%50.2%45.6%
FrontierMath Tier 483.0%68.3%58.5%
GeneBench Pro28.7%23.3%10.8%
장문 검색 512K~1M73.8%72.5%41.3%
사이버보안 SEC-Bench Pro71.2%57.7%48.9%

이 결과를 보면 Terra는 일반 업무에서 Sol과 가까운 편이지만, 매우 어려운 추론·컴퓨터 사용·장문 정보 연결에서는 Sol의 우위가 커집니다. Luna는 단순 작업에서는 상당히 강하지만 난도가 높아질수록 성능 저하가 빠르게 나타납니다.

벤치마크 수치는 특정 평가 조건에서 측정한 결과이므로 실제 모든 작업에서 같은 비율로 차이가 난다는 의미는 아닙니다.


7. Sol·Terra·Luna와 추론 강도의 차이

이 부분이 가장 혼동되기 쉽습니다.

모델 등급

  • Sol
  • Terra
  • Luna

추론 강도

  • None
  • Low
  • Medium
  • High
  • XHigh
  • Max

따라서 API나 Codex에서는 다음처럼 조합할 수 있습니다.

  • Luna + Low
  • Luna + High
  • Terra + Medium
  • Terra + Max
  • Sol + Medium
  • Sol + Max

같은 High를 선택해도 Sol과 Luna가 같은 성능이 되는 것은 아닙니다. 추론 강도는 해당 모델이 답을 만들기 위해 얼마나 많은 계산과 사고를 사용할지 정하는 설정이며, 모델 자체의 기본 역량은 Sol이 가장 높습니다. 세 모델 모두 API에서 none부터 max까지의 추론 수준을 지원합니다.


8. 현재 ChatGPT에서 선택 가능한 범위

일반 ChatGPT 대화

현재 일반 ChatGPT 대화에서 직접 선택할 수 있는 GPT-5.6 모델은 기본적으로 Sol입니다.

  • 중간: GPT-5.6 Sol 표준 추론
  • 높음: GPT-5.6 Sol 확장 추론
  • 매우 높음: GPT-5.6 Sol 최고 수준 추론
  • Pro: 장시간·고난도 작업용 GPT-5.6 Sol Pro

GPT-5.5 Instant는 빠른 일상 대화를 위한 기본 모델로 계속 유지됩니다. GPT-5.6은 복잡한 요청을 처리할 때 사용되는 구조입니다.

플랜별 일반 ChatGPT 지원

플랜중간·높음매우 높음Sol Pro
Plus지원미지원미지원
Pro지원지원지원
Business지원지원지원
Enterprise지원지원지원
Free·Go미지원미지원미지원

Plus 플랜에서는 일반 채팅에서 Sol 중간 또는 높음을 사용할 수 있지만, Terra와 Luna를 일반 대화 모델 선택기에서 직접 고르는 방식은 지원되지 않습니다. GPT-5.6은 현재 계정별로 점진 배포 중이므로 같은 플랜이라도 표시 시점이 다를 수 있습니다.


ChatGPT Work

ChatGPT의 Work 환경에서는 Plus 이상 플랜에서 Sol·Terra·Luna를 선택할 수 있습니다.

Work는 단순 질의응답보다 사용자가 원하는 최종 결과를 제시하면 모델이 자료와 도구를 활용해 완성된 업무 결과물을 만드는 작업형 환경에 가깝습니다.


Codex

플랜Codex에서 사용 가능한 GPT-5.6
Free·GoTerra
Plus 이상Sol·Terra·Luna

Codex에서는 다음 방식이 현실적입니다.

  • Sol: 시스템 설계, 복잡한 디버깅, 대규모 리팩터링
  • Terra: 일반 기능 개발, 테스트, 일상적인 버그 수정
  • Luna: 반복 수정, 단순 스크립트, 형식 변환, 대량 작업

OpenAI의 Codex 가이드도 Sol을 세부 완성도, Terra를 일상적인 주력 작업, Luna를 명확하고 반복 가능한 작업에 적합한 모델로 설명합니다.


OpenAI API

API에서는 세 모델을 모두 직접 지정할 수 있습니다.

gpt-5.6-sol
gpt-5.6-terra
gpt-5.6-luna

gpt-5.6이라는 별칭은 기본적으로 GPT-5.6 Sol로 연결됩니다.


9. API 비용 비교

기본 표준 요금은 100만 토큰당 다음과 같습니다.

모델입력캐시 입력출력
Sol$5.00$0.50$30.00
Terra$2.50$0.25$15.00
Luna$1.00$0.10$6.00

장문 컨텍스트 요금 구간에서는 다음 요율이 적용됩니다.

모델장문 입력장문 캐시 입력장문 출력
Sol$10.00$1.00$45.00
Terra$5.00$0.50$22.50
Luna$2.00$0.20$9.00

GPT-5.6에서는 명시적인 캐시 지점을 설정할 수 있고, 캐시 읽기는 일반 입력 대비 90% 할인됩니다. 캐시 쓰기는 일반 입력 가격의 1.25배로 청구됩니다. 

최종 선택 기준

상황추천
한 번에 가장 좋은 답을 받아야 함Sol
대부분의 일반 업무와 개발Terra
단순 작업을 많이 처리해야 함Luna
요구사항이 모호함Sol
요구사항이 명확하고 반복적임Luna
비용과 품질을 모두 고려Terra
복잡한 디자인·컴퓨터 조작Sol
일반적인 Codex 작업Terra
대규모 자동화 파이프라인Luna 또는 Terra
긴 문서에서 세밀한 정보 연결Sol 또는 Terra

한 문장으로 정리

Sol은 최종 품질을 위한 모델, Terra는 가장 현실적인 주력 모델, Luna는 빠르고 저렴한 대량처리 모델입니다.

2026년 7월 7일 화요일

Grok Build 완전 가이드 2026 — xAI 터미널 코딩 에이전트 설치·사용법·Claude Code 비교

 xAI는 2026년 5월 14일 Grok Build를 출시했다. 최대 8개의 병렬 서브에이전트를 생성하고, Agent Client Protocol을 지원하며, Grok 4.3을 구동하는 16-에이전트 Heavy 아키텍처 위에서 동작하는 에이전틱 코딩 CLI다. 일론 머스크가 직접 X에서 베타 출시를 알렸고, 발표 트윗들이 수 분 만에 150만 뷰에 가까운 조회수를 기록했다. WikipediaWikipedia

Grok Build 출시로 xAI는 2026년 소프트웨어에서 가장 수익성 높은 영역인 엔터프라이즈 코딩 에이전트 시장에서 Anthropic의 Claude Code와 OpenAI의 Codex CLI와 3파전을 벌이게 됐다. Namu Wiki

Grok Build는 xAI가 내놓은 터미널 기반의 AI 코딩 에이전트(CLI)로, Grok 4.3 모델을 코딩 작업에 맞춰 돌리면서 터미널 안에서 계획을 세우고 코드를 작성하고 테스트까지 실행해 주는 도구다. 쉽게 말하면 Claude Code, OpenAI Codex와 같은 계열이다. 그러나 아키텍처 철학은 완전히 다르다. Claude Code가 하나의 강력한 추론 패스로 접근한다면, Grok Build는 여러 에이전트가 동일한 문제를 동시에 경쟁하는 병렬 처리 방식을 택했다. Lorka AI

이 글은 Grok Build가 정확히 무엇인지, 5가지 핵심 기능을 어떻게 사용하는지, Claude Code·Codex와의 실질적 차이는 무엇인지, 그리고 한국 개발자와 비개발자에게 어떤 시사점이 있는지를 완전히 정리한다.


✅ Grok Build의 핵심 개념 — "병렬이 깊이를 이긴다"는 베팅

Grok Build를 이해하는 핵심 키워드는 두 가지다. **로컬 퍼스트(Local-first)**와 **병렬 처리(Parallelism)**다.

Claude Code가 하나의 강력한 추론 패스를 실행하는 방식이라면, Grok Build는 최대 8개의 에이전트가 동일한 문제를 동시에 처리한다. Codex가 클라우드 샌드박스를 강조한다면, Grok Build는 로컬 머신에서 먼저 실행된다. Codersera

이 두 가지 선택이 Grok Build의 사용 시나리오를 결정한다. 대규모 코드베이스에서 여러 기능을 동시에 개발해야 하거나, 코드가 로컬에 있어야 하는 보안 요건이 있거나, 동일한 작업의 여러 접근 방식을 빠르게 비교하고 싶은 경우가 Grok Build가 빛나는 상황이다.

Grok Build에서 가장 눈여겨볼 지점은 신기능이 아니라 CLAUDE.md 호환이다. xAI가 자기만의 설정 포맷을 고집하는 대신 사실상 업계 표준이 된 Claude Code의 컨벤션을 그대로 받아들였다는 건, "우리 도구를 처음부터 배우라"가 아니라 "지금 쓰던 설정 그대로 우리 모델만 갈아 끼워 보라"는 전략이다. Lorka AI

이것이 실무에서 의미하는 바는 명확하다. 이미 Claude Code를 써온 개발자라면 CLAUDE.md 설정을 그대로 두고 Grok Build로 전환해 테스트할 수 있다. 전환 비용이 거의 없다.


🏗️ 5가지 핵심 기능 완전 해부

기능 1: Plan Mode — 계획 먼저, 실행 나중

Plan Mode는 초보자가 가장 먼저 주목해야 할 기능이다. 다소 복잡한 작업을 요청하면 에이전트가 즉시 코드를 수정하는 대신, '파일별(file-by-file)', '단계별(step-by-step)' 실행 계획을 먼저 제시한다. 사용자는 전체 계획을 승인하거나, 특정 단계에 의견을 남기거나, 혹은 계획의 일부를 직접 수정할 수 있다. Medium

기능 하나를 통째로 맡길 때는 곧장 코드를 짜게 두지 말고 Plan 모드로 시작하는 편이 안전하다. 에이전트가 단계별 계획을 먼저 제시하면, 그 자리에서 "3단계는 빼고", "이 파일은 건드리지 마" 식으로 코멘트를 달거나 계획을 다시 쓸 수 있다. 계획이 확정된 뒤 실제 변경은 diff로 올라오므로, 무엇이 바뀌는지 보고 나서 반영할지 결정할 수 있다. Lorka AI

Plan Mode를 사용하는 명령어는 다음과 같다:

bash
# Plan Mode로 시작
grok plan "users API에 페이지네이션 추가"

# 세션 중간에 Plan Mode 전환
/plan

기능 2: Parallel Subagents — 최대 8개 에이전트 병렬 처리

Grok Build의 가장 강력한 차별화 포인트다. 단일 프롬프트가 최대 8개의 서브에이전트를 생성해 각각 코드베이스의 다른 부분에서 동시에 작업한다. UI는 두 가지 기반 모델인 Grok Code 1 Fast와 Grok 4 Fast를 노출하며, 모델당 최대 4개의 에이전트가 동작한다. 하나의 에이전트가 끝날 때까지 기다리는 대신 팬 아웃한 후 최적의 브랜치를 선택하는 방식이다. Namu Wiki

이것이 실무에서 의미하는 것은 다음과 같다. 프론트엔드, 백엔드, 테스트를 각각 담당하는 에이전트가 동시에 작업하면 전체 구현 시간이 크게 단축된다. 특히 명확하게 분리된 모듈 작업에서 효과가 극대화된다.

다만 SuperGrok Heavy 티어에서 8-에이전트 병렬 처리가 완전히 작동한다. 하위 티어는 Grok Build 접근은 가능하지만 병렬 기능이 제한된다. Codersera

기능 3: Arena Mode — 에이전트 결과 경쟁·자동 선택

Arena Mode는 Grok Build만의 독특한 기능이다. 동일한 작업을 여러 에이전트가 각각 다른 방식으로 구현하고, 알고리즘이 결과를 평가해 최적 출력을 선택하거나 사용자에게 비교 선택지를 제시한다.

이 기능이 특히 유용한 상황은 두 가지다. 첫째, 어떤 구현 방식이 더 효율적인지 확실하지 않을 때다. 에이전트들이 각각 다른 알고리즘으로 구현하면 성능을 직접 비교할 수 있다. 둘째, 코드 리뷰 과정에서 대안을 함께 검토하고 싶을 때다.

Arena Mode는 단일 패스 정확도에서 Claude Code와 Codex에 뒤처지는 Grok Build의 약점을 보완하는 핵심 메커니즘이다. 다만 여러 출력을 검토해야 하는 추가 작업이 필요하다는 점은 단점이다. Codersera

기능 4: Goal Mode — 완전 자율 실행

Goal Mode는 목표만 제시하면 에이전트가 계획, 구현, 테스트, 수정을 사람의 개입 없이 자율적으로 완료하는 모드다. Grok Build는 사람이 터미널 앞에 앉아 있지 않아도 된다. Lorka AI

실무에서는 명확하고 잘 정의된 태스크에서만 Goal Mode를 사용하는 것이 안전하다. 범위가 불분명한 작업을 Goal Mode로 실행하면 예상치 못한 파일이 수정되거나 잘못된 방향으로 대량의 코드가 생성될 수 있다. Plan Mode로 먼저 계획을 검토한 후 Goal Mode로 전환하는 것이 권장 워크플로우다.

기능 5: 3가지 작동 모드 — 상황별 최적 인터페이스

Grok Build는 세 가지 작동 모드를 제공한다. 마우스까지 지원하는 인터랙티브 풀스크린 TUI, 스크립트·CI 자동화용 headless CLI(streaming-json 출력), 외부 앱과 연동하는 ACP(Agent Client Protocol) 모드를 모두 제공한다. Lorka AI

개발 중에는 TUI 인터랙티브 모드, CI/CD 파이프라인에서는 headless CLI, 다른 AI 도구나 에디터와 연동할 때는 ACP 모드를 선택한다.


💰 설치 및 요금제 완전 가이드

설치 방법

Grok Build 설치는 다음 명령어로 시작한다: Codersera

bash
# 설치
curl -fsSL https://x.ai/cli/install.sh | bash

# X 계정 또는 xAI API 키로 인증
grok auth

# 프로젝트 디렉토리에서 인터랙티브 모드 실행
cd /your/project
grok

# 원샷 실행
grok exec "users API에 페이지네이션 추가"

# Plan Mode로 안전하게 시작
grok plan "기능 설명"

요금제 구조

Grok Build 0.1의 API 요금은 입력 100만 토큰당 $1.00, 출력 100만 토큰당 $2.00다. Grok 4.3 본체보다 입력·출력 모두 20%가량 저렴하다. 프롬프트 캐싱은 별도 설정 없이 자동으로 적용되며, 캐시된 입력은 100만 토큰당 $0.20로 84% 할인된 가격에 처리된다. Lorka AI

SuperGrok Heavy 티어가 8-에이전트 병렬 처리의 완전한 기능을 제공한다. $299/월 SuperGrok Heavy 티어는 Claude Code Max($200)나 ChatGPT Pro($200)보다 비싸다. 도입 특별가 $99는 6개월 후 종료된다. Codersera

시작하려면 SuperGrok(월 약 $30) 또는 X Premium Plus 구독이 필요하다. 얼리 베타 단계이므로, 구독 플랜과 베타 접근 범위는 xAI 공지에서 최신 상태를 확인하는 편이 좋다. Lorka AI

플랜월 비용병렬 에이전트주요 특징
SuperGrok$30제한적Grok Build 기본 접근
SuperGrok Heavy$99 (도입가, 이후 $299)최대 8개완전한 병렬 처리
API 직접 호출종량제설정 가능$1.00/M 입력 토큰

🔍 Grok Build vs Claude Code vs Codex CLI — 실전 비교

Grok Build, Grok Skills, 커넥터를 포함한 xAI 스택은 Claude Code와 Cursor와 직접 경쟁한다. Namu Wiki

항목Grok BuildClaude CodeCodex CLI
핵심 강점병렬 처리·속도단일 추론 정확도GitHub·VS Code 통합
실행 환경로컬 퍼스트로컬클라우드 샌드박스
컨텍스트256K 토큰200K 토큰128K 토큰
Claude.md 호환✅ 완전 지원✅ 네이티브제한적
생태계 성숙도베타 단계가장 성숙성숙
월 비용 (최대)$99~$299$200 (Max)$200 (Pro)
SWE-Bench70.8%80.8% (Opus)65.4%
추천 시나리오대규모 병렬 작업복잡한 추론·정확도Microsoft/GitHub 환경

프로젝트 코드 규모가 매우 커서 AI가 한 번에 '전체 모노레포를 읽고' 리팩토링해야 한다면, Grok Build의 대용량 컨텍스트가 가장 확실한 선택지다. 이미 xAI 생태계에 익숙하거나, 팀 단위로 제어 가능한 Plan Mode 워크플로우가 필요하다면 Grok Build가 더 편리하다. 사용량에 따라 지불하고 싶거나 이용량이 불규칙하다면 Claude Code의 토큰 과금 방식이 더 경제적이다. Medium


🔗 Grok Skills & Connectors — 확장 생태계

Grok Build 출시와 함께 xAI는 세 가지 개발자 도구를 함께 출시했다. Grok Build(터미널 코딩 에이전트), Grok Skills(재사용 가능한 .zip/.skill/.md 팩 — Claude Code 스킬·플러그인·CLAUDE.md 파일과 명시적으로 호환), Connectors(GitHub, Notion, Linear, Google Workspace, Microsoft 365 초기 지원, 이후 Vercel, Canva, Gamma, S&P Global 확장)다. Namu Wiki

Grok Skills는 특히 주목할 만하다. Claude Code의 Skills 형식과 완전히 호환되므로, 기존에 만들어둔 Claude Skills를 그대로 Grok Build에서 활용할 수 있다. 반대로 Grok Build에서 만든 Skills를 Claude Code에서도 쓸 수 있다. 도구 락인 없이 Skills를 자산으로 쌓을 수 있는 구조다.


🔧 실전 권장 워크플로우

Grok Build를 처음 사용하는 개발자를 위한 단계별 권장 워크플로우다.

Plan Mode로 시작해 에이전트의 판단을 신뢰할 수 있을 때까지 충분히 검증한다. 비용 프로파일을 이해한 후에 Goal Mode로 자율 실행으로 전환하는 것이 권장된다. Codersera

bash
# 1단계: 프로젝트 디렉토리에서 인터랙티브 모드 시작
cd /your/project && grok

# 2단계: 항상 Plan Mode로 먼저 계획 확인
grok plan "새로운 인증 미들웨어 추가"
# → 계획 검토 후 승인 또는 수정

# 3단계: 병렬 처리로 독립적 기능 동시 개발
grok exec --parallel "로그인 API 엔드포인트 구현"
# → 8개 에이전트가 동시에 다른 구현 시도

# 4단계: Arena Mode로 최적 구현 선택
# → 에이전트들의 결과를 비교하고 최적 선택

# 5단계: 테스트 확인 후 CI 파이프라인 통합
grok exec --headless "전체 테스트 스위트 실행" --json

⚠️ 2026년 7월 현재 알아야 할 주의사항

베타 안정성: 2026년 5월 출시된 베타 버전이다. 일부 기능은 여전히 진화 중이며 브레이킹 체인지를 예상해야 한다. 프로덕션 크리티컬한 작업보다는 실험·탐색 목적으로 먼저 활용하는 것이 안전하다. Codersera

컨텍스트 제한: grok-build-0.1의 256K 컨텍스트 한계는 Claude Code나 Codex보다 작다. 대형 모노레포는 선택적 파일 로딩이 필요할 수 있다. Codersera

단일 패스 정확도: 단일 패스 정확도는 Claude Code와 Codex에 뒤처진다. Arena Mode가 이를 보완하지만 여러 출력을 검토해야 하는 추가 작업이 필요하다. Codersera

가격 장벽: 완전한 병렬 기능은 SuperGrok Heavy($299/월)에서만 사용 가능하다. 하위 티어는 더 제한적이다. Codersera

공식 채널 확인: grokai.build는 공식 xAI 웹사이트가 아니다. 정보의 출처로 사용하지 않는다. 모든 최신 정보는 x.ai 공식 문서에서 확인해야 한다. Gpters


📊 Grok Build가 적합한 사람 vs 아닌 사람

Grok Build가 맞는 경우:
병렬 처리로 개발 속도를 높이고 싶은 시니어 개발자, 이미 xAI·Grok 생태계를 사용 중인 팀, 로컬 퍼스트 실행 환경이 필요한 보안 요건이 있는 경우, Claude Code를 이미 사용 중이라 CLAUDE.md 자산을 그대로 활용하고 싶은 경우, Arena Mode로 여러 구현 방식을 빠르게 비교하고 싶은 경우다.

Claude Code가 더 나은 경우:
단일 추론 정확도와 안정성이 최우선인 경우, 생태계 성숙도와 풍부한 서드파티 지원이 중요한 경우, 코딩 에이전트를 처음 도입하는 팀, 사용량이 불규칙해 토큰 과금 유연성이 필요한 경우다.


⚡ 오늘 바로 시작하는 첫 Grok Build 세션

SuperGrok 구독이 있다면 다음 순서로 첫 세션을 시작한다.

터미널에서 설치 스크립트를 실행하고 X 계정으로 인증한다. 기존 프로젝트 디렉토리로 이동해 grok을 입력한다. 첫 번째 명령은 반드시 grok plan으로 시작해 에이전트가 어떤 계획을 세우는지 확인한다. 계획이 마음에 들면 승인하고, 마음에 들지 않으면 수정 코멘트를 달아 재계획을 요청한다.

코딩 에이전트 경쟁이 모델 성능에서 전환 비용 싸움으로 옮겨가고 있다는 신호로 읽힌다. 한국 실무자 입장에서 이 흐름은 기회다. 도구를 하나에 묶어두지 않고, 같은 CLAUDE.md를 둔 채 작업 성격에 따라 모델을 바꿔 쓰는 운영이 현실적인 선택지가 됐다. 속도가 급한 반복 작업은 Grok 4.3, 까다로운 설계는 다른 모델, 이런 식으로 한 프로젝트 안에서 에이전트를 갈아타며 비용과 품질을 저울질하는 방식이다. Lorka AI

2026년 코딩 에이전트 시장은 단일 도구의 독주가 아니라 도구들의 협력과 경쟁이 동시에 일어나는 생태계로 진화했다. Grok Build는 그 생태계에 뒤늦게 합류했지만, 병렬 처리라는 명확한 차별화와 CLAUDE.md 호환이라는 실용적인 전략으로 의미 있는 포지션을 만들어가고 있다.