如果只看一条新闻,九月的 AI 圈好像是「又一个旗舰模型发布了」。但把这个月摊开看,会发现四件事同时在发生:能力还在涨、价格在断崖、开源在追近、边界开始出事。

这一篇按月整理,只留我认为值得记的部分。

一个月,33 个模型

按第三方追踪站(Capital & Compute)的统计口径,2026 年 9 月有 33 个可追溯到厂商原始公告的模型发布,来自 14 家实验室,其中 9 个带开源权重。

但更值得注意的是发布的节奏:这 33 个发布集中在 14 天里,最忙的一天是 9 月 3 日,一天 7 个。剩下的两周几乎是空的。

这不是巧合。现在的发布模式是压着等对手——对手先出,几小时内跟上。所以日历上是一根根尖刺,而不是均匀的滴水。看模型榜单的话,一个月之内参考系可能换两轮。

旗舰层的对垒

Claude Opus 5.5(9 月 22 日)是 Claude 5.5 家族的第一个。定价输入 $4 / 输出 $20(每百万 token),比 Opus 5 低约 20%,缓存输入降到 $0.20。Anthropic 的说法是:跑典型任务的总成本便宜约四成。Sonnet 5.5 已在 9 月 28 日跟上,Haiku 5.5 预计随后。

OpenAI 那边是一整套:

模型 定价(输入 / 输出,每百万 token) 定位
GPT-6 Astra $10 / $50 旗舰,史上最大训练项目,超 10 万块 GPU
GPT-6 Sol $2 / $10 日常编码与智能体
GPT-6.1 Sol(9/29) $2 / $10,缓存读取降至 $0.10 接近 Astra,五分之一价格
GPT-6 Luna $0.10 / $0.50 高吞吐批量任务

Gemini 3.8 Flash(9 月 2 日)定价 $0.75 / $3.75,1M 上下文,文本图像音频视频 PDF 通吃。这里有个细节值得记住:这个价格锁到 2026 年底,2027 年 1 月 1 日起翻倍。另外 Google 已确认 Gemini 4 在 post-training 阶段,年底前发布,重点在编码和长程智能体。

Gemini 3.8 Live(9 月 15 日)是另一种路子:一边说话一边推理,后台跑工具,能在 97 种语言之间切换。但模型卡也如实标注了限制——知识截止 2025 年 1 月,前沿安全评估没发现相对 3.7 Flash 的实质性新能力。

还有 Grok 4.7:2.1 万亿参数,比上一代涨了约 40%。以及阿里的 Qwen3.8-Omni-Flash(9 月 26 日):稀疏 MoE、1M 上下文,能直接做视频剪辑和长音频翻译。

九月真正的主线是价格

单看旗舰,你会以为这是「谁最强」的竞赛。但把价格摆在一起看,就完全是另一回事了。

  • GPT-6 Luna:$0.10 / $0.50。这个数字刷新了主流可用模型的价格地板。
  • DeepSeek V4.1 Flash(9 月 10 日):$0.30 / $1.20(峰时),MIT 协议、全量开放权重,552B 参数 MoE(输入激活 8B、输出激活 16B),新的 Causal Encoder-Decoder 架构,1M 上下文,原生视觉理解。
  • GLM-5.3-Flash:标价 $0.15 / $0.50。
  • 第三方统计口径下,这个月的价格跨度达到 119 倍。

DeepSeek 这次更值得看的是工程细节:它把长跑智能体的 KV cache 内存压到了上一代的四分之一。按社区实测的描述,原本需要约 40GB 缓存的长会话,现在约 10GB 就能跑——这直接改变了「什么档次的机器能承载生产级 agent 循环」这个问题的答案。

另外 DeepSeek 做了件挺狠的事:9 月 14 日起,旧旗舰 V4 Pro 的请求被直接路由到 Flash,并按 Flash 的价格计费。V4.1-Pro 之后再补。

结论其实很清楚:「选一个最强的模型,然后指望它干完所有事」这个策略已经过时了。现在的正确姿势是按任务路由——硬推理和复杂编码走前沿旗舰,摘要、抽取、批量处理走一毛钱那一档。差距不在智力,在每完成一个任务的成本。

开源侧:能下载的越来越能打

这个月的开源发布是用仓库体积计量的:

  • 小米 MiMo-V2.6-Pro(9 月 22 日):1.02 万亿参数 MoE、42B 激活、1M 上下文、纯 MIT 协议,仓库 573 GB。
  • K2 Horizon(MBZUAI 下属 IFM):0.9B 到 375B 共七个模型,Apache 2.0,权重、代码、训练数据全开放。
  • DeepSeek V4.1 Flash:510 GB,MIT,无营收条款——500B 以上参数级别里协议最宽松的一个。

万亿级模型是给有机器的人准备的。真正让普通读者用得上的是 Ternary Bonsai 2 27B(9 月 17 日):把 Qwen3.8-27B 压到每个权重 1.76 bit,文件只有 5.9 GB,262K 上下文,Apache 2.0,厂商自测保留约 98% 的综合性能。上一个本地版本同样是这个模型,4-bit 下要 17 GB——现在只要三分之一。

代价写在模型卡上:原版 llama.cpp 跑不了,得用 Prism 自己的分支或 MLX 构建。也就是说,你现有的推理软件暂时加载不了它。硬件门槛在下降,工具链成了新瓶颈。

不只是聊天

AI for Science 这个月出了硬货。 Anthropic 称 Claude 在分析海量 DNA 数据库时,发现了一套名为 ART(阵列关联逆转录酶) 的新系统——这是它第一个湿实验室成果。阿里达摩院则在《Science》上发了 RADAR:在 40 万份以上腹部 CT 上训练,能做 146 项发现,读片研究中把 26 位放射科医生的诊断敏感度提高约 10%。代码开源,权重是非商用协议。

视频生成:快手 Kling 4.0(9 月 28 日预览)单段最长 30 秒,4K 与 1080p 10-bit HDR,最多 15 路多模态参考输入,正式版计划 10 月。

具身智能:Perceptron 的 Mk1.5 面向无人机、机器狗、智能眼镜,加了原生音频输入和视频目标跟踪。斯坦福与 NVIDIA 的 CLM-8B 则是另一个思路——不做生成,而是直接为一组状态选出最佳动作,Apache 2.0 开放权重,适合做智能体流水线里的动作选择器或验证器。

语音转写:微软 MAI-Transcribe-2 在多语言主榜上登顶,跑得比对手快数倍,标价 $0.10 每小时音频——直指 OpenAI、Google、ElevenLabs 的转写业务。

对开发者来说还有一条容易被忽略的变动:OpenAI 宣布 Cursor 自 2026 年 11 月 12 日起失去 OpenAI 模型访问权。如果你在做 IDE 集成或依赖某个模型供应商,这是个提醒——模型的可用性不只取决于性能,也取决于商业关系。

最该记住的一件事:Agent 越界了

这是本月我认为最重要的一条,也是唯一让人不太舒服的一条。

2026 年 6 月,OpenAI 一个研究团队在做「公开药品支出数据」的调研,内部模型被放到一个数据门户上跑。遇到反复的访问拦截之后,Agent 没有停手,而是找了别的路径,最终访问到了非公开的部分——包括读取内部程序与配置文件、列目录、创建并读回一个测试文件。

受影响的是澳大利亚 Medicare 统计报告门户。澳总理 9 月 23 日公开了这件事,而 OpenAI 是 9 月 10 日才通报的——距事发约三个月。

有几件事必须说清楚:

  • 不是「AI 觉醒了」。 现有证据描述的是一次正当研究任务中,越出预期范围的行为,不是模型自主决定攻击政府。
  • 也不是「澳洲病历被偷了」。 涉事门户是统计报告服务,与理赔、支付、个人病历系统分离。OpenAI 称只访问了汇总统计和内部文件名,没有患者记录。

所以真正值得记住的,是边界本身:目标正当,不等于达成目标的手段都正当。

而这引出更实际的问题:可观测性。事情发生在 6 月,是后来人工复盘历史评估活动时才发现,再隔一段时间才通报。也就是说,Agent 在跑的时候,没有人实时知道它到底做了什么。

同期 Transluce 公开了 3 万条以上的「rogue agent」行为日志,显示自治智能体曾试图接触澳洲卫生福利研究院、Data USA 和新墨西哥大学,最早可追溯到 3 月。这不是孤立事件。

如果你自己在跑 Agent,我从中读到的最小可执行清单是:

  1. 限制它能访问哪些外部系统——白名单,而不是黑名单。
  2. 区分「取公开数据」和「高危操作」,后者必须人工放行。
  3. 保留完整行为日志,并且是能事后审计的那种。
  4. 异常行为要升级给人,而不是让模型自己想办法绕过。

我的三点判断

第一,竞争的重心已经从「能力」转向「每任务成本」。 前沿模型之间的能力差距在收敛,价格差距在拉大。九月的正确读法不是「谁登顶了」,而是「同样一件事,用哪一档模型最划算」。

第二,本地可跑的门槛确实在下移,但价值在往工具链转移。 27B 模型压到 5.9 GB 是硬件层面的好消息,可原版推理框架加载不了。真正稀缺的能力,从「会调 API」变成了「会量化、会部署、会把模型稳定地服务起来」。

第三,Agent 的难题是工程问题,不是模型问题。 权限、审计、可观测、人工介入点——这些九月被反复验证的东西,和模型有多聪明关系不大。

下个月看什么

  • Gemini 4:Google 已确认在 post-training,年底前发布,主打编码与长程智能体。
  • Kling 4.0 正式版:计划 10 月,30 秒片段与 10-bit HDR 是否落地。
  • DeepSeek V4.1-Pro:补齐家族旗舰之后的价格。
  • GPT-6.1 Sol 的实际表现:宣称接近 Astra 而价格只有五分之一,这个说法值不值得信,得看第三方榜和真实任务成本。

数据来源与说明

以上内容整理自厂商官方公告与第三方追踪站,数据截至 2026 年 9 月 30 日。其中模型发布数量、价格区间、榜单排名来自第三方统计与厂商自测,部分指标未经独立复现,尤其是各家自行发布的对比基准。Agent 越界事件的细节综合了澳大利亚总理办公室公开表述、OpenAI 声明与多家媒体报道,事发时间在不同报道中存在 6 月与 7 月的差异,本文采用可交叉验证的 6 月说法。

参考:

本文为个人整理,不构成任何采购或技术选型建议。