IT·AI 심층 스크랩 — 2026년 9월 2일
Alibaba의 Qwen3.8-Flash-Next가 SWE-bench Pro 등에서 Claude Opus 4.6을 앞서며 오픈 웨이트 진영의 격차를 좁혔고, Z.ai는 GLM-5 최초의 네이티브 멀티모달 모델 GLM-5.3-Flash를 MIT 라이선스로 공개했습니다. Anthropic은 9월 1일로 예정됐던 Sonnet 5 가격 인상을 철회하고 $2/$10 요금을 영구화했습니다.
AI 모델 — Alibaba Qwen3.8-Flash-Next, 일부 벤치마크에서 Claude Opus 4.6 추월
Alibaba Qwen 팀이 8월 26일 Qwen3.8-Flash-Next를 오픈 웨이트로 공개했습니다. 차세대 Qwen4 아키텍처를 미리 보여주는 모델로, 총 125B 파라미터에 토큰당 활성 파라미터는 6B에 불과합니다 (The Decoder). 여기에 시스템 RAM에서 동작하는 51B 규모의 N-gram 임베딩 레이어를 별도로 두는 구조가 특징입니다. 네이티브 컨텍스트는 262,144 토큰이며 YaRN 을 적용하면 100만 토큰까지 확장됩니다 (TechNode).
벤치마크에서는 Claude Opus 4.6 대비 일부 지표를 앞섰습니다. SWE-bench Pro 62.5 대 53.4, LiveCodeBench v6 91.9 대 88.8 로 Flash-Next 가 우위를 보였고, GPQA Diamond 는 91.7 대 91.3 으로 근소하게 앞섰습니다(The Decoder). QwenCloud API 가격은 입력 100만 토큰당 $0.16, 출력 $0.47 로 책정됐습니다. Qwen 팀은 이전 모델 Qwen3.7-Plus 대비 학습 비용을 약 9분의 1로 줄이면서 이 성능을 냈다고 밝혔습니다.
실무 영향
- 코딩·오피스 업무 특화 오픈 웨이트 모델로, 자체 호스팅이나 저비용 API 대안을 찾는 팀에 선택지가 하나 늘었습니다. 가중치는 GitHub·Hugging Face·ModelScope 에 공개됐습니다.
- 벤치마크 우위가 실제 프로덕션 코드베이스에서도 재현되는지는 별개 문제입니다. 특정 벤치마크 점수만으로 모델을 교체하기보다 자체 워크로드로 먼저 검증하는 편이 안전합니다.
AI 모델 — Z.ai, GLM-5 최초 네이티브 멀티모달 모델 GLM-5.3-Flash 공개
Z.ai 도 같은 날(8월 26일) GLM-5.3-Flash 를 공개했습니다. GLM-5 계열 중 처음으로 텍스트·이미지· 영상을 한 번에 처리하는 네이티브 멀티모달 모델이며, 총 320B 파라미터에 활성 파라미터는 18B 인 MoE 구조입니다. 컨텍스트 윈도우는 104만 8,576 토큰(1M) 이고 가중치는 MIT 라이선스로 열려 있습니다(GMI Cloud).
아키텍처상 특징은 희소(sparse) 어텐션과 선형(linear) 어텐션을 결합한 하이브리드 구조로, 기본 GLM-5.3 대비 어텐션 연산량을 약 3분의 1, KV 캐시를 약 4분의 1로 줄였다고 설명합니다. 30조 토큰 코퍼스로 학습했으며, 코딩 벤치마크 TerminalBench 2.1 에서 84.3점을 기록해 Claude Opus 4.8 의 85.0점에 근접했습니다. 정식 출시 전에는 OpenCode·OpenRouter 에 “ox-alpha” 라는 익명 이름으로 먼저 풀려 그 주 가장 인기 있는 모델이 됐습니다(TestingCatalog). API 가격은 입력 100만 토큰당 $0.15, 출력 $0.50 입니다.
실무 영향
- MIT 라이선스 멀티모달 오픈 웨이트 모델이라는 점에서, 이미지·영상이 섞인 에이전트 워크플로를 자체 인프라에 올리려는 팀에 실질적인 대안이 됩니다.
- 같은 주에 Qwen3.8-Flash-Next 와 GLM-5.3-Flash 가 나란히 공개되며, 중국 진영 오픈 웨이트 모델의 코딩·에이전트 벤치마크가 프론티어 클로즈드 모델과의 격차를 빠르게 좁히는 흐름이 이어지고 있습니다.
AI 인프라 — Anthropic, Sonnet 5 가격 인상 철회 · $2/$10 영구화
Anthropic 이 6월 30일 Sonnet 5 를 출시하며 8월 31일까지 한시적으로 적용하겠다던 introductory 가격(입력 $2/output $10, 100만 토큰당)을 영구 표준가로 확정했습니다. 원래 9월 1일부터 적용될 예정이던 $3/$15(50% 인상) 로의 전환은 시행되지 않습니다. 공식 가격 문서에도 “9월 1일로 예정됐던 인상은 발생하지 않는다”는 안내가 명시돼 있습니다 (Claude Platform Docs — Pricing).
Sonnet 5 는 출시 발표 당시부터 이 가격을 introductory 가격으로 표기했었는데 (Anthropic — Introducing Claude Sonnet 5), 이번 결정으로 해당 문구가 사라지고 표준가로 굳어졌습니다.
실무 영향
- Sonnet 5 를 프로덕션 에이전트의 주력 모델로 쓰는 팀은 9월 예산에 반영해뒀던 50% 단가 인상을 그대로 빼도 됩니다.
- 배치 API 할인($1/$5)·프롬프트 캐싱 배수도 이 표준가를 기준으로 계속 적용되므로, 비용 최적화 전략을 다시 짤 필요는 없습니다.
출처
- Alibaba releases Qwen3.8-Flash-Next, targeting "ultimate cost efficiency" — The Decoderhttps://the-decoder.com/alibaba-releases-qwen3-8-flash-next-targeting-ultimate-cost-efficiency/
- Alibaba's Qwen to open-source Qwen3.8-Flash-Next, previewing Qwen4 architecture — TechNodehttps://technode.com/2026/08/26/alibabas-qwen-to-open-source-qwen3-8-flash-next-previewing-qwen4-architecture/
- GLM-5.3-Flash: The Stealth Model That Became the Talk of the Timeline — GMI Cloudhttps://www.gmicloud.ai/en/blog/glm-53-flash-the-stealth-model-that-became-the-talk-of-the-timeline
- Z.ai launches GLM-5.3-Flash under MIT license — TestingCataloghttps://www.testingcatalog.com/z-ai-launches-glm-5-3-flash-under-mit-license/
- Pricing — Claude Platform Docshttps://platform.claude.com/docs/en/about-claude/pricing
- Introducing Claude Sonnet 5 — Anthropichttps://www.anthropic.com/news/claude-sonnet-5