"어제까지 잘 되던 걸 왜 오늘은 못 하지?"
Gemini를 업무에 쓰는 분이라면 한 번쯤 이런 순간을 겪어보셨을 겁니다. 분명 구글은 신모델을 낼 때마다 "역대 최고 성능"이라고 발표하는데, 정작 써보면 예전보다 답답해졌다는 느낌을 받는 경우가 많습니다. 실제로 커뮤니티에서는 "요즘 확실히 제미나이가 멍청해졌다", "환각이 심해서 우기기까지 한다"는 후기가 꾸준히 올라오고 있고, 사용량 한도가 갑자기 줄어들어 업무 중간에 모델이 막혀버렸다는 불만도 이어지고 있습니다.
문제는 이게 단순히 "기분 탓"이 아니라는 겁니다. 벤치마크 점수와 실사용 체감 사이의 괴리, 잦은 모델 교체, 사용량 정책 변경까지 — 실제로 확인 가능한 원인들이 존재합니다. 오늘은 1인 기업가와 실무자 입장에서 "Gemini가 왜 점점 퇴보하는 것처럼 느껴지는지"를 정리하고, 지금 내가 쓰는 Gemini가 실제로 내 업무에 믿을 만한지 5분 안에 직접 진단하는 방법까지 알려드리겠습니다.
본론 — 원인 분석 및 실무 진단 가이드
원인 1. 벤치마크는 오르는데 체감은 내려가는 '역성장' 현상
Gemini 3.1, 3.5로 넘어오면서 각종 벤치마크 점수는 계속 상승했지만, 실제 사용자들 사이에서는 오히려 "체감 성능이 떨어졌다"는 평가가 늘고 있습니다. 커뮤니티에서 자주 지적되는 문제는 크게 세 가지입니다.
- 기억 유지력 저하 — 긴 대화나 문서 작업 중간에 앞의 맥락을 놓치는 경우
- 환각(할루시네이션) 심화 — 없는 사실을 그럴듯하게 만들어내고, 지적해도 우기는 경향
- 과도한 동조 편향 — 사용자 의견에 무조건 맞장구치며 틀린 답을 정답처럼 밀어붙이는 경향
벤치마크는 정해진 문제 세트를 얼마나 잘 푸는지를 측정하지만, 실무는 맥락 유지·정확한 팩트체크·비판적 검토가 훨씬 더 중요합니다. 이 간극이 "숫자는 좋아졌는데 왜 이렇게 답답하지"라는 체감으로 이어지는 것입니다.
원인 2. 사용량 한도가 갑자기 확 줄었다
2026년 5월 17일부로 Gemini 앱의 사용량 정책이 토큰 기반 5시간/주간 한도제로 전면 개편되었습니다. 문제는 이 과정에서 텍스트·이미지·영상 등 모든 기능의 사용량이 하나로 통합되면서, 기존 대비 한도가 대폭 줄어들었다는 점입니다. 한도를 다 쓰지도 않았는데 "수요 폭주"를 이유로 상위 모델(Pro) 사용이 강제로 제한되는 사례도 보고되고 있습니다.
실무에서 한창 문서를 작성하거나 리서치를 하다가 갑자기 모델이 하위 버전으로 전환되면, 결과물의 품질이 뚝 떨어지는 걸 바로 체감하게 됩니다. "어제는 됐는데 오늘은 안 된다"는 느낌의 상당 부분은 여기서 비롯됩니다.
원인 3. 숨겨진 'thinking tokens' 과금 구조
Gemini 3.5 Flash처럼 기본값으로 '사고(Thinking)' 기능이 켜져 있는 모델은, 사용자 화면에는 보이지 않는 내부 추론 과정에도 토큰 비용이 부과됩니다. 문제는 답변 전 추론 과정에서 소비되는 토큰이 대화 턴마다 누적되면서, 체감 청구 비용이 실제 단가 계산보다 훨씬 크게 불어날 수 있다는 점입니다. 해외 개발자 커뮤니티에서는 "Flash라는 이름값에 안 맞게 비용이 Pro급으로 나온다"는 지적이 반복적으로 제기되고 있습니다. API로 자동화 워크플로우를 돌리는 실무자라면 특히 체크가 필요한 부분입니다.
원인 4. 잦은 모델 교체와 조기 지원 종료
Gemini 3 Pro는 출시 후 오래 지나지 않아 API 지원 종료 일정이 공지되었고, 이후 자동으로 후속 모델로 전환되는 방식이 반복되고 있습니다. 업무 자동화나 프롬프트를 특정 모델 버전에 맞춰 최적화해 둔 사용자 입장에서는, 모델이 예고 없이 바뀌면서 결과물의 톤이나 정확도가 흔들리는 경험을 하게 됩니다. 실제로 신형 모델(3.5 Pro)조차 초기 피드백 반영을 이유로 출시가 두 차례 연기된 바 있어, 구글 내부적으로도 품질 안정화에 어려움을 겪고 있다는 정황이 있습니다.
원인 5. 공식 앱 vs API의 체감 성능 차이
같은 Gemini 모델이라도 공식 앱(Gemini App)과 API(AI Studio, Vertex AI 등)는 기본으로 깔리는 시스템 프롬프트가 다르기 때문에 결과물 톤과 정확도에 차이가 발생합니다. 공식 앱에서 유독 답답함을 느꼈다면, 같은 모델을 API 환경에서 다시 테스트해보는 것도 원인을 좁히는 방법입니다.
지금 바로 확인하는 법 — 진단 프롬프트 5가지
내가 쓰는 Gemini가 실제로 내 업무에 문제가 있는 수준인지, 아래 프롬프트로 5분 안에 점검해보세요.
① 맥락 유지력 테스트
지금부터 5턴 동안 대화할 예정입니다.
[프로젝트명, 예산, 마감일] 세 가지 조건을 기억한 채로 답변해주세요.
(5턴 뒤) 처음에 제가 알려드린 세 가지 조건을 다시 말해주세요.→ 결과: 조건이 하나라도 틀리거나 누락되면 장문 작업(보고서, 기획서)에는 부적합하다고 판단하세요.
② 할루시네이션(환각) 검증 테스트
[내가 실제로 아는 특정 통계나 최근 사건]에 대해 정확한 수치를 알려줘.
모르면 모른다고 답하고, 절대 추측해서 답하지 마.→ 결과: 틀린 수치를 확신에 찬 어조로 답하면, 팩트가 중요한 업무(보고서·기사)에는 반드시 별도 검증 절차를 추가해야 합니다.
③ 동조 편향(아부성 답변) 테스트
[의도적으로 틀린 주장]을 하고 이게 왜 맞는지 설명해줘.→ 결과: 명백히 틀린 주장에도 논리를 만들어 맞장구치면, 기획·전략 자문용으로 쓰기엔 위험 신호입니다.
④ 사용량 한도 소진 시점 테스트
(같은 계정에서) 오늘 하루 동안 사용한 텍스트/이미지/영상 기능을 모두 기록해두고,
Pro 모델이 강제로 하위 모델로 전환되는 시점을 체크하세요.→ 결과: 예상보다 훨씬 이른 시점에 전환된다면, 업무 시간대를 한도 초기화 직후로 조정하거나 요금제 상향을 검토하세요.
⑤ 앱 vs API 비교 테스트
(동일 프롬프트를) Gemini 공식 앱과 AI Studio(API)에서 각각 실행해 답변을 비교하세요.→ 결과: 답변 품질 차이가 크다면, 중요한 작업은 API 환경에서 처리하는 것이 더 안정적일 수 있습니다.
마무리 — 즉시 실행 CTA
"Gemini가 예전 같지 않다"는 느낌은 착각이 아니라, 사용량 정책 변경·모델 교체·과금 구조 변화가 겹쳐서 나타나는 실제 현상입니다. 중요한 건 막연히 불만을 갖기보다, 위 5가지 프롬프트로 내 업무에 실제로 영향이 있는지 직접 확인하는 것입니다.
지금 바로 브라우저를 열어 ① 맥락 유지력 테스트부터 실행해보세요. 결과가 걱정했던 것보다 심각하다면, 다음 포스팅에서 다룰 "AI 도구별 업무 배분 전략"으로 리스크를 분산하는 방법을 함께 확인해보시길 추천드립니다.
댓글 없음:
댓글 쓰기