AI 작업 노트

AI 모델·코딩 에이전트 브리핑 — 2026년 9월 15일 정오 기준

Aurora Lux 2026. 9. 15. 14:49

전날 이후 새 프런티어 모델 출시는 없습니다. 대신 오늘은 실제 사용자에게 꽤 직접적인 변화가 3건 있습니다. 가장 중요한 건 DeepSeek가 V4 Pro 강제 교체 방침을 뒤집은 것, Claude Code의 주간 사용량 프로모션이 실제로 종료돼 지난주보다 체감 한도가 줄어든 것, 그리고 Grok 4.7은 여전히 나오지 않은 가운데 xAI의 다음 모델인 4.8 로드맵이 처음 구체적으로 공개된 것입니다.

 

1. DeepSeek, V4 Pro 강제 종료 철회 — 어제까지의 브리핑을 중요하게 정정

확인된 사실 · 9월 15일 현재: DeepSeek 공식 가격 문서가 이제 deepseek-v4-pro를 9월 14일 이후에도 계속 제공한다고 명시하고 있습니다. 이유도 직접 “사용자 요구에 대응해”라고 밝혔습니다. 가격도 기존과 동일하게 유지됩니다. (DeepSeek API Docs)

이건 상당히 중요한 방향 전환입니다. DeepSeek는 V4.1 Flash 출시 당시 공식적으로 9월 14일 04:00 UTC부터 모든 deepseek-v4-pro 요청을 V4.1 Flash로 자동 라우팅하고 Flash 요금을 적용하겠다고 발표했습니다. 즉 며칠 전 제가 전달했던 “Pro endpoint도 결국 Flash로 바뀐다”는 내용은 당시에는 공식 발표에 근거한 것이었지만, 현재는 철회됐습니다. (DeepSeek API Docs)

현재 두 모델을 그대로 선택할 수 있습니다. V4.1 Flash의 비피크 요금은 캐시 입력 $0.003/M, 일반 입력 $0.15/M, 출력 $0.60/M이고, V4 Pro는 각각 $0.022 / $0.66 / $1.98입니다. 즉 Pro는 비피크 기준 캐시 입력 약 7.3배, 일반 입력 4.4배, 출력 3.3배 비쌉니다. 대신 Flash에는 native vision이 있고 Pro에는 없습니다. 둘 다 1M context와 tool calling을 지원합니다. (DeepSeek API Docs)

왜 이 철회가 중요한지는 지난 며칠 사용자 반응에서 드러났습니다. 코딩·에이전트에서는 Flash가 빠르고 훨씬 싸다는 평가가 강했지만, 창작·roleplay·특정 지식 작업에서는 Pro가 더 일관되고 Flash로 강제 교체되는 것을 원하지 않는다는 반발이 적지 않았습니다. Reddit에서는 Pro 종료 공지를 두고 “새 Flash가 RP에는 명백히 더 나쁘다”는 글이 100표 이상을 받았고, 별도 DeepSeek 스레드에서는 이번 철회에 대해 빠른 커뮤니티 대응을 긍정적으로 보는 의견과, 정책·모델명이 너무 자주 바뀐다는 불만이 함께 나왔습니다. 이는 사용자 사례이지 품질을 일반화할 근거는 아닙니다. (Reddit)

오늘 판단: 이건 사용자 입장에서는 좋은 변화입니다. deepseek-v4-pro라는 이름 아래 모델을 몰래 교체하는 것보다 Flash의 극단적인 가성비가 필요한 작업은 Flash, 기존 Pro에서 검증한 workflow·문체·추론 특성이 중요한 작업은 Pro로 명시적으로 나누는 편이 훨씬 안전합니다.

특히 production agent를 운영한다면 오늘부터는 “Pro가 곧 없어지니 무조건 Flash로 migration”할 필요가 없습니다. 오히려 동일 작업을 둘 다 돌려 완료 비용·재작업 횟수·품질을 비교한 뒤 움직이는 게 맞습니다.

 

2. Claude Code — 주간 사용량이 지난주 대비 실제 약 16.7% 줄었다

확인된 사실 · Anthropic Help Center, 9월 14일 갱신: 5월 13일부터 9월 13일까지 Claude Code에는 원래 한도보다 50% 높은 임시 주간 사용량이 적용돼 있었습니다. 이 프로모션이 종료됐고, Anthropic은 원래 한도로 완전히 복귀하는 대신 프로모션 전 기준보다 25% 높은 한도를 영구화했습니다. 대상은 Pro, Max, Team 및 기존 seat-based Enterprise입니다. (Claude Help Center)

헷갈리기 쉬운 부분이라 숫자로 보면 간단합니다. 프로모션 전 한도를 100이라고 하면 지난주까지는 150, 지금부터는 125입니다. 따라서 장기 기준으로는 예전보다 25% 넉넉하지만, 바로 지난주와 비교하면 실제 사용 가능량은 약 16.7% 감소했습니다.

그리고 5시간 사용량 제한은 이번 변경과 무관합니다. Anthropic은 프로모션이 주간 한도에만 적용됐으며 5시간 한도는 바뀌지 않았다고 명확히 적었습니다. 따라서 최근 “몇 시간 만에 quota가 급격히 사라졌다”는 일부 사용자 보고까지 이번 16.7% 변화의 결과라고 연결하면 안 됩니다. (Claude Help Center)

Reddit 반응은 꽤 거셉니다. r/ClaudeCode의 관련 글은 800표 이상을 받았고, 일부 사용자는 Qwen·Kimi·Grok·로컬 모델이나 Codex를 routine coding에 쓰겠다고 반응했습니다. 반면 다른 스레드에서는 “애초에 50% 추가분은 명시적으로 기간 한정 프로모션이었다”는 지적도 나옵니다. 4개월간 유지돼 신규 사용자에게 사실상 정상 한도로 느껴졌기 때문에, 두 해석이 충돌하는 상황입니다. (Reddit)

여기서 가성비 관점의 의미가 꽤 큽니다. Claude/Fable급 모델을 모든 repo 탐색·테스트 생성·문서 수정까지 계속 쓰는 방식은 지난주보다 동일 월 구독료로 처리할 수 있는 작업량이 줄었습니다. 반면 DeepSeek V4.1 Flash, GLM Flash, Muse 같은 worker를 앞단에 두고 어려운 설계·리뷰·디버깅만 Claude로 올리는 방식의 상대적인 경제성은 더 좋아졌습니다.

오늘 판단: Claude Code가 갑자기 나빠진 것은 아닙니다. 다만 heavy user라면 지난주 사용량을 기준으로 이번 주 workload를 계획하면 안 됩니다. 특히 멀티에이전트 fan-out을 많이 쓴다면 routine worker를 싼 모델로 빼는 이유가 하나 더 생겼습니다.

 

3. Grok 추적 — 4.7은 여전히 미출시, 그런데 Musk가 벌써 4.8의 규모를 공개

확인된 사실: xAI 공식 API 모델 목록은 오늘도 Grok 4.6을 최신 flagship으로 표시합니다. grok-4.7이나 grok-4.8의 API model ID, 가격, model card는 없습니다. Grok 4.6은 그대로 500K context, 입력 $2/M, cached $0.50/M, 출력 $6/M입니다. (X AI Docs)

새로운 X 발언 · Elon Musk, 9월 14일: Musk는 아직 출시되지 않은 Grok 4.7에 대해 “Opus 5.0과 대략 비슷한 수준이며 5.1 수준은 아니다. 어떤 면에서는 낫고 어떤 면에서는 떨어지며 multimodal을 고쳐야 한다”고 밝혔습니다. 지난달 “현존 모델을 모두 넘을 가능성”을 언급했던 것과 비교하면 4.7에 대한 기대치를 상당히 현실적으로 낮춘 표현입니다. 이것은 공급사 대표의 사전 평가이지 독립 benchmark가 아닙니다. (TeslaNorth.com)

더 새롭게 공개된 것은 Grok 4.8입니다. Musk는 X에서 4.8이 2.5T 규모이며 새로운 C++ 소프트웨어 스택으로 학습 중이고, 이번 주 pretraining을 끝낸 뒤 RL로 넘어갈 예정이라고 말했습니다. 이어 4.8은 4.7보다 눈에 띄게 개선되고, 4.9는 Astra/Fable급이 될 가능성이 있다고 주장했습니다. 하지만 xAI는 아직 기술 보고서나 모델 카드, benchmark를 공개하지 않았기 때문에 2.5T 규모·새 스택·성능 전망 모두 현재는 Musk의 개발 로드맵 발언으로 분류해야 합니다. (TeslaNorth.com)

실사용자 입장에서 오히려 더 흥미로운 부분은 4.7을 건너뛰어야 하는가입니다. Reddit의 4.8 관련 스레드에서는 “4.7도 아직 늦고 있는데 4.8 출시를 기대하기에는 이르다”는 회의가 많았고, 반대쪽에서는 경쟁 모델에 근접하면서 가격만 Grok 4.6 수준을 유지한다면 충분히 매력적이라는 기대도 나왔습니다. 일부 coding 사용자는 현재도 일반 chat보다 Grok Build/CLI를 훨씬 높게 평가하고 있습니다. 모두 사전 기대이므로 모델 평가로 취급하면 안 됩니다. (Reddit)

오늘 판단: Grok 4.7은 아직 기다리는 모델입니다. 오히려 이번 새 발언으로 “4.7이 곧 모든 경쟁자를 압도한다”는 기대는 낮추는 편이 맞습니다. 실제 출시 뒤 확인해야 할 것은 benchmark 한두 개보다 앞서 지연 원인이 됐던 어려운 작업을 끝까지 수행하고 스스로 검증하는 능력, 그리고 coding/agent에서 Grok 4.6 대비 작업당 token·시간이 얼마나 줄었는지입니다.

4.8은 흥미롭지만 지금 당장 모델 선택에 반영할 정보는 아닙니다.

 

오늘의 결론

오늘 하나만 기억한다면 DeepSeek의 정책 철회입니다. 며칠 전 공식적으로 예고됐던 V4 Pro → V4.1 Flash 강제 전환이 취소돼 V4 Pro를 그대로 계속 사용할 수 있게 됐습니다. 이는 단순 모델 하나를 더 남긴 게 아니라, 검증된 production workflow를 공급사가 다른 checkpoint로 강제로 바꾸는 위험을 없앴다는 점에서 꽤 큰 변화입니다. (DeepSeek API Docs)

두 번째는 Claude Code입니다. 모델 성능 변화는 없지만 지난주보다 포함된 주간 사용량이 약 16.7% 줄었기 때문에, 고가 프런티어 모델을 모든 작업에 쓰는 전략의 경제성이 조금 더 나빠졌습니다. (Claude Help Center)

그리고 Grok은 4.7 미출시 상태가 계속됩니다. 4.8의 2.5T·C++ stack 로드맵은 새 정보지만 아직 사용자에게 돈을 쓰거나 workflow를 바꿀 근거는 아닙니다. 현재 공식적으로 구매·호출 가능한 최신 모델은 여전히 Grok 4.6입니다. (X AI Docs)

그 외 OpenAI·Google·Qwen·Kimi·GLM·Muse 쪽에서는 전날 브리핑 이후 모델 선택을 바꿀 정도의 새 프런티어 출시, 대형 가격 인하, 신규 오픈웨이트 공개를 오늘 정오까지 확인하지 못했습니다. 그래서 반복하지 않았습니다.