전날 이후 새로운 초대형 프런티어 모델 출시는 없지만, 실제 모델 선택과 비용 구조에 영향을 줄 변화는 꽤 있습니다. 오늘 가장 눈에 띄는 건 Kimi K2.8 Preview가 Kimi Code 전체에 풀리면서 “K3에 가까운 성능을 절반 수준의 진입 구독료로 쓰는” 포지션이 생긴 것, 그리고 Claude Code가 장시간·멀티에이전트 운용의 prompt-cache 낭비를 다시 줄인 것입니다. DeepSeek V4.1 Flash는 출시 하루 뒤 실제 사용자 평가가 빠르게 쌓이면서 장점과 단점도 훨씬 선명해졌습니다.
1. Kimi K2.8 Preview — 오늘 가장 흥미로운 가성비 후보
확인된 사실 · Kimi, 9월 11일: K2.8 Preview가 Kimi Code에 전면 배포됐습니다. 기존 kimi-for-coding을 그대로 쓰면 자동으로 K2.8 Preview가 들어오므로 OpenCode 등에서 별도 모델 ID 변경도 필요 없습니다. 최대 1M context, low / high / max reasoning을 지원하고, Kimi는 성능을 “K3에 가깝다”고 설명합니다. (Kimi)
가성비 측면에서 중요한 건 요금제 구조입니다. 가장 저렴한 Andante가 월 ¥49인데 여기서 K2.8 Preview와 최대 1M context를 쓸 수 있습니다. 반면 K3는 최소 Moderato ¥99부터 열리고, 이 단계에서는 K3 context가 256K입니다. K3의 1M context는 더 상위 Allegretto부터입니다. 즉 구독형 코딩 용도라면 K2.8은 K3 진입 가격의 약 절반으로 1M context를 주는 모델이 됐습니다. (Kimi)
다만 여기서 “K3에 가깝다”는 Kimi 자체 평가입니다. 아직 오늘 시점에 Artificial Analysis 같은 독립 평가나 충분한 실사용 A/B가 나오지는 않았습니다. 또한 Kimi Code는 순수 무제한 API가 아니라 회원 크레딧과 5시간·주간 제한이 있는 구독 서비스이므로 ¥49를 단순 API 월정액처럼 해석하면 안 됩니다. (Kimi)
실사용 포지션은 꽤 매력적입니다. Kimi 자체 설명도 K2.8을 completion·일상 개발 작업에서 생각 효율이 높은 모델로 두고 있고, 큰 코드베이스나 최고난도 작업은 여전히 K3 쪽에 무게를 둡니다. 따라서 지금 계속 관찰해 온 구조로 치면 DeepSeek/GLM급 worker와 K3급 상위 모델 사이를 노리는 모델에 가깝습니다.
사용자 반응 · Reddit, 9월 11일: 출시 글은 빠르게 관심을 받았지만 아직 hands-on 평가는 적습니다. 반응의 상당수는 “K3 다음에 왜 K2.8이냐”는 네이밍 농담과 회의감이고, 실제 사용자 중에는 K2.7의 속도에 K3에 가까운 지능이 붙는다면 이상적인 모델이 될 수 있다며 기대하는 의견이 보입니다. 아직 “실제로 K3와 비슷하다”고 말할 정도의 근거는 없습니다. (Reddit)
오늘 판단: 오늘 새로 직접 시험해볼 모델 하나를 고른다면 저는 K2.8 Preview를 우선순위 높게 둡니다. 특히 대형 repo 읽기, 문서화, 평범한 기능 구현, 반복 수정처럼 최고 수준의 추론보다 1M context + 낮은 진입비용이 중요한 작업에서 흥미롭습니다.
2. Claude Code 2.1.269 — 또 한 번 ‘모델 IQ보다 캐시와 에이전트 런타임’ 개선
확인된 사실 · Anthropic, 9월 11일: Claude Code v2.1.269가 나왔습니다. 이번에도 모델 자체의 성능 향상보다 장시간 작업 비용과 멀티에이전트 안정성에 직접 영향을 주는 수정이 많습니다.
가장 중요한 수정은 두 가지입니다. 출력 token limit에 걸려 자동 resume된 다음 turn에서 prompt cache가 부분적으로 무효화되던 문제, 그리고 Claude가 생각 중일 때 사용자가 중단한 세션을 resume하면 과거 context가 다른 형태로 다시 전송되어 cache 재사용률이 떨어지던 문제를 고쳤습니다. Cloud session 시작 직전 서버 설정 로딩 타이밍 때문에 발생하던 별도의 cache miss도 수정됐습니다.
이건 Fable처럼 입력·cache 가격 차이가 큰 모델을 긴 세션에서 돌릴 때 꽤 중요합니다. 앞선 버전들에서도 cache regression이 실제 quota·비용 체감에 큰 영향을 줬는데, 이번에는 자동 resume와 interruption이라는 또 다른 cache 손실 경로를 막은 셈입니다. 다만 이 릴리스만으로 기존 Fable 5.1 관련 모든 cache 불만이 해결됐다고 볼 근거는 아직 없습니다.
멀티에이전트도 재미있습니다. CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS로 한 workflow에서 최대 256개의 inference-bound agent까지 허용할 수 있게 됐고, /goal이 API/network/token 오류 뒤 조용히 멈춰버리던 문제도 backoff retry 또는 명시적 pause로 바뀌었습니다. 웹의 scheduled routine에서 subagent를 쓴 작업이 너무 일찍 완료 처리되어 retry가 누락되거나 중복 실행되던 문제도 수정됐습니다.
VS Code에는 현재 살아 있는 subagent들을 카드 형태로 보고, 개별 agent를 중단하거나 transcript를 읽을 수 있는 agent map도 추가됐습니다. “여러 agent를 쓰는 것”보다 “누가 뭘 하고 있는지 알 수 있게 만드는 것”이 점점 제품 차별점이 되고 있다는 점에서 의미가 있습니다.
사용자 반응: 2.1.269 자체는 너무 새로워 Reddit/X에서 신뢰할 만한 합의가 아직 없습니다. 따라서 오늘은 공식 변경점 이상의 품질 평가는 붙이지 않겠습니다.
오늘 판단: Claude Code에서 긴 세션·resume·subagent를 자주 쓴다면 업데이트 가치가 높은 버전입니다. 새 모델 없이도 이런 cache 수정 하나가 실제 비용에는 benchmark 몇 점보다 크게 작용할 수 있습니다.
3. DeepSeek V4.1 Flash — 출시 하루 만에 ‘싸지만 작업당 싸지는 않을 수 있다’는 반론이 커졌다
어제는 정식 출시·오픈웨이트·가격을 다뤘으므로 오늘은 그 이후 새로 쌓인 실제 사용 반응만 보겠습니다.
사용자 체감 · 9월 11일: 코딩 사용자들의 긍정 평가는 여전히 “매우 빠르다” 쪽입니다. 출시 스레드에서는 기존 V4 Flash보다 깨끗한 코드를 만들고 버그를 빨리 찾았다는 사용자, agentic coding·보안 작업에서 상당히 좋다는 사용자가 있습니다. 반면 같은 스레드에서 GLM-5.3보다 실제 체감이 떨어진다는 의견도 바로 맞섭니다. (Reddit)
오늘 더 중요하게 봐야 할 건 완료된 작업 기준 비용에 대한 문제 제기입니다. 한 사용자는 실제 코딩에서 nested if/else, 일회성 patch, 중복 logic이 자주 생겨 유지보수성이 떨어졌고, PDF/PPT agent 작업에서도 GPT-6는 비교적 바로 해결한 반면 V4.1 Flash는 옆길로 새며 tool call을 많이 소비했다고 평가했습니다. 즉 토큰당 가격이 싸다고 작업 하나를 끝내는 총비용까지 반드시 싼 것은 아니라는 주장입니다. 단일 사용자 경험이지만 중요한 관찰입니다. (Reddit)
또 다른 상당히 반응이 큰 coding 후기는 V4.0 Flash보다 불필요한 논쟁, 잘못된 가정, 초보적인 실수, 과도한 thinking, 요청하지 않은 추가 수정, 이전 turn의 맥락 오염이 늘었다고 강하게 비판했습니다. 이것 역시 개인 사례지만, 어제부터 반복되던 “surgical edit를 요청했는데 스스로 일을 크게 벌린다”는 패턴과 일치합니다. (Reddit)
따라서 하루가 지난 현재 평가는 조금 더 명확해졌습니다.
V4.1 Flash의 강점: 엄청 싼 token, 빠른 inference, repo 탐색·대량 작업·여러 번 시도해도 부담이 적음.
현재 반복적으로 나오는 약점: 작은 수정에도 탐색과 reasoning을 과하게 하고, 필요 이상의 코드를 건드리거나 장기 유지보수성이 좋지 않은 해결책을 내놓는 경우가 있음.
그래서 오늘도 대량 worker → 상위 모델 review 구조에는 아주 매력적이지만, “싸니까 모든 coding turn을 V4.1로 바꾼다”는 결정은 조금 더 기다려 보는 편이 좋겠습니다.
4. Grok 추적 — 4.7은 아직 없지만, X Search 비용 구조가 크게 바뀐다
Grok 4.7: 9월 12일 정오 현재 xAI 공식 모델 페이지에는 여전히 Grok 4.6이 New·flagship으로 표시됩니다. 500K context, 입력 $2/M, 출력 $6/M이며 grok-4.7 API ID, 모델 카드, 가격표, benchmark는 아직 없습니다. 따라서 앞서 언급했던 Musk의 출시 일정 추정은 현재까지 공식 제품 출시로 이어지지 않았습니다. 다만 9월 12일 하루가 아직 끝난 것은 아니므로 “일정이 완전히 미뤄졌다”고 단정하지는 않겠습니다. (Grok API Documentation)
그 대신 Grok 기반 agent를 쓰는 사람에게 꽤 중요한 확정된 가격 변화를 오늘 새로 포착했습니다.
확인된 사실 · xAI 문서: 9월 21일 12:00 PT부터 x_search 과금 방식이 변경됩니다. 현재는 $5 / 1,000 calls인데, 이후에는 가져온 X 게시물 1,000개당 $5, 사용자 프로필 1,000개당 $10으로 바뀝니다. 검색 결과에 포함된 부모·인용 게시물까지 모두 개별 건수로 계산됩니다. (Grok API Documentation)
이건 단순 가격표 숫자 변경이 아니라 과금 단위 자체가 call → 결과량으로 바뀌는 것입니다. 현재 한 번의 x_search에서 게시물을 여러 개 받아도 call 한 번으로 계산되지만, 앞으로는 가져온 게시물 수만큼 비용이 쌓입니다. 따라서 “최근 AI 반응을 X에서 넓게 훑어라”처럼 많은 결과를 반복적으로 가져오는 Grok research agent는 비용이 상당히 증가할 가능성이 있습니다. 반대로 아주 적은 결과만 가져오는 좁은 검색은 영향이 작을 수 있습니다. (Grok API Documentation)
예를 들어 단순 계산상 한 호출에서 게시물 20개를 가져온다면 현재 tool fee는 약 $0.005지만 새 방식에서는 약 $0.10입니다. 모델 token 비용은 별도이므로, broad social-listening agent에서는 tool 비용을 다시 계산할 필요가 있습니다.
이 변화에 대한 Reddit/X의 유의미한 사용자 합의는 아직 찾지 못했습니다. 공식 문서에는 이미 명시돼 있지만 아직 9월 21일 전이라 실제 청구 경험은 나오지 않은 상태입니다.
오늘 Grok 판단: 모델 자체는 변화 없음. 그러나 X 실시간 검색을 Grok의 강점으로 활용하는 research/agent workload에서는 9월 21일 비용 구조가 실제로 꽤 중요한 변화입니다.
5. 전날 브리핑에서 빠졌던 고영향 확인사항 — OpenAI Agents API
이건 9월 10일 공개라 엄밀히 말해 오늘 새로 출시된 것은 아니지만, 전날 브리핑에 포함되지 않았던 중요한 사실이라 보완합니다.
OpenAI가 Agents API를 모든 개발자에게 public beta로 공개했습니다. 핵심은 Codex에서 쓰는 agent harness를 API로 관리형 제공하는 것입니다. 자동 context compaction, session recovery, tool search, parallel subagent, MCP/custom function 연결을 OpenAI가 관리하며, 실행 환경은 OpenAI sandbox뿐 아니라 자체 인프라와 Cloudflare·Vercel·Modal·E2B 등의 외부 환경도 붙일 수 있습니다. (OpenAI)
중요한 가격 포인트는 Agents API 자체의 추가 orchestration 요금이 없다는 것입니다. public beta에서는 모델 token과 사용한 tool·sandbox 비용만 냅니다. 즉 직접 agent loop, compaction, retry, subagent orchestration을 구축하느라 개발비를 쓰던 팀에게는 꽤 현실적인 대안입니다. (OpenAI)
Reddit 초기 반응은 아직 작지만, 긍정 쪽은 “Codex 수준의 harness를 직접 다시 만들 필요가 없어졌다”는 점을 높게 보고 있고, 반대쪽은 sandbox와 자체 infra를 섞을 때 secret·권한·session logging의 보안 경계를 누가 책임질 것인가를 문제로 봅니다. 현재 표본은 너무 작아서 제품 품질에 대한 합의로 보기는 어렵습니다. (Reddit)
오늘의 결론
오늘 가성비 관점에서 가장 새로운 모델은 Kimi K2.8 Preview입니다. 독립 평가가 아직 없다는 큰 단서는 있지만, 월 ¥49의 가장 낮은 회원 등급에서 1M context와 K3에 가깝다는 공급사 성능을 제공한다는 구조는 충분히 시험해볼 만합니다. K3 자체는 최소 ¥99이고 그 단계에서는 256K context이므로, “프런티어 최고 성능”보다 큰 context를 오래 쓰는 coding worker를 찾는다면 K2.8이 꽤 흥미로운 위치에 들어왔습니다. (Kimi)
DeepSeek V4.1 Flash는 반대로 하루 만에 평가가 조금 현실화됐습니다. 토큰 가격과 속도는 압도적으로 매력적이지만, 작은 수정에서 과도하게 탐색하거나 코드를 불필요하게 복잡하게 만드는 사례가 반복적으로 나오기 시작했습니다. 따라서 API 가격만 보고 “가장 싼 모델”이라고 결론내리기보다 완료된 작업 하나당 시간·tool call·재작업 횟수까지 비교하는 게 좋겠습니다. (Reddit)
그리고 Grok 4.7은 오늘 정오까지 여전히 공식 출시가 확인되지 않았습니다. 대신 Grok/X 기반 research agent를 실제로 운영한다면 9월 21일 X Search의 결과량 기반 과금 전환이 오늘 포착한 Grok 관련 가장 실질적인 변화입니다. (Grok API Documentation)
'AI 작업 노트' 카테고리의 다른 글
| AI 모델·코딩 에이전트 브리핑 — 2026년 9월 15일 정오 기준 (0) | 2026.09.15 |
|---|---|
| GPT와 함께한 인터넷 공유기 설정을 위한 여정(...) (0) | 2026.09.07 |
| Codex 크레딧을 아끼는 방법 (feat. 웹 GPT) (0) | 2026.08.30 |
| 옵시디언과 코덱스를 함께 쓰면 달라지는 점 (0) | 2026.08.10 |
| 내 정보는 누구에게 맡겨야 하나? 다양한 AI에 관한 생각 (0) | 2026.08.08 |