一个月9款旗舰,大模型进入“月抛”时代?

一、7月成为近一年少见的发布高峰

1、7月成为近一年少见的发布高峰

从月初腾讯混元Hy3发布正式版并开源,到月末Anthropic发布Claude Opus 5,其间Kimi K3、Qwen3.8-Max预览版、Grok 4.5等模型陆续登场。

7月成为近一年少见的发布高峰。

各家选择的时间点并不相同。有的厂商借竞品更新后的间隙跟进发布,有的厂商选在世界人工智能大会前后亮相,也有厂商通过价格调整回应市场竞争。

但7月不只是模型发布的数量多,更值得注意的是这轮发布反映出的两个变化。

第一,模型之间的能力差距正在缩小。

Artificial Analysis最新综合智能指数显示,头部模型之间的分差已经明显收窄。

随着版本快速迭代,“最强模型”的位置越来越难长期保持,各家开始围绕不同任务寻找优势,而不是追求单一维度的绝对领先。

第二,开源模型正在进入第一梯队。

7月发布的新模型中,腾讯混元Hy3、Kimi K3等选择开放权重(开放模型参数,允许开发者自行下载和部署)。

其中,Kimi K3在Code Arena前端编程榜单中排名第一,超过GPT-5.6 Sol和Claude Fable 5。

2、开源模型更多被视为闭源模型的追赶者

过去两年,开源模型更多被视为闭源模型的追赶者,而这一轮竞争显示,开源模型已经开始在部分开发场景中与闭源模型直接竞争。

过去几年,大模型行业主要比拼通用能力,谁的知识面更广、谁的回答更准确。但现在,竞争维度已经变了。

OpenAI继续强化编程和复杂推理,并持续扩展Codex生态,希望通过开发工具绑定程序员用户。

Anthropic押注代码理解和安全审计,帮助开发者处理大型项目中的复杂工程问题。

Grok 4.5则强调速度和低成本,并与AI编程工具Cursor绑定,覆盖日常开发场景。

大模型研究者姚宇航告诉「定焦One」,各家公司都在重点投入编程能力,差距也在快速缩小,比如Kimi K3的代码能力提升明显,正在接近头部闭源模型的水平。

Agent是各家争夺的另一个方向。

GPT-5.6 Sol配合Codex探索自动化编程,Opus 5强调长程任务执行,Kimi K3展示连续运行完成复杂任务的能力,腾讯混元Hy3则试图结合微信生态探索智能体应用。

但Agent在实际工作中仍不成熟。

独立开发者北城表示,目前部分智能体产品的短板不在能不能调用工具,而在任务调度能力。

例如,Codex的Ultra模式会开启很多子代理,不同的子代理重复读取同一个文件,进行类似分析,最后Token消耗增加,但真正有效的工作并没有增加。

二、智能体能力提升不能只靠增加子代理数量

在他看来,智能体能力提升不能只靠增加子代理数量,关键在于能否判断哪些任务值得分析、哪些步骤可以省略。

姚宇航的看法类似。他认为智能体是目前最值得关注的方向,但离真正成熟还有距离。

在他看来,医疗、金融等垂直领域的智能体仍有较大机会;

下一阶段拉开差距的关键不只是模型能力本身,还在于智能体在具体场景中好不好用、客户愿不愿意买单。

国产模型则通过不同能力的提升寻找突破口。

Kimi K3选择强化长上下文、前端编程和产品设计能力,在多个编程测试中进入头部位置,能力接近国外闭源旗舰模型。

7月发布的多款模型进入了万亿甚至数万亿参数区间,但参数规模已经不能简单等同于能力高低。

随着MoE架构的发展,模型可以拥有更大的参数容量,同时只激活其中一小部分来完成推理,降低实际计算成本。

行业由此形成两条路线:一是继续扩大规模,用更大参数换更强能力;二是强调效率,用更小的激活参数实现接近旗舰模型的效果。

海外厂商更多采取差异化定价策略。

1、Anthropic则维持高性能旗舰模

OpenAI选择进一步细分市场,将GPT-5.6拆分为不同版本,让用户根据任务复杂程度选择对应模型;

Anthropic则继续维持高性能旗舰模型路线,通过Opus系列覆盖高价值开发和企业场景;

Grok 4.5则采取低价策略,输出价格仅为Opus系列的四分之一,并通过与Cursor的绑定吸引开发者。

国内厂商则更强调成本优势。过去半年,多家国内模型厂商持续下调API价格,希望通过低成本降低使用门槛,扩大开发者和企业用户规模。

一句话总结,7月的大模型竞争已经从单一能力比拼,扩展到代码、智能体、参数效率和价格多个维度。

综合相比前代的变化、榜单表现和开发者反馈,7月发布的模型的水平大致可以分为三类。

先看超出预期的一类:Kimi K3、Grok 4.5、混元Hy3。

其中最受关注的是Kimi K3。

该模型采用MoE架构,总参数规模达到万亿级别,重点强化了长上下文、前端编程和产品设计能力。

发布当天,Kimi K3就以1679分登上Code Arena前端编程榜第一,相比前代Kimi K2.6的第18名,提升17个位次。

在一周后的Arena综合榜上,Kimi K3则首次进入全球Top 10。

三、其幻觉率从Kimi K2.6的39%升至51

1、输出速度约33 Token/s

但Kimi K3也有明显的能力边界。

Artificial Analysis的知识可靠性测试中,其幻觉率从Kimi K2.6的39%升至51%,输出速度约33 Token/s,远低于同类模型。

开发者的实际使用感受也印证了这种“偏科”。

北城认为Kimi K3相比上一代确实有明显提升,优势主要集中在前端开发、UI设计和产品表达。

例如在优化网站UI、设计APP界面这类任务中,Kimi K3能产出更好的产品,但涉及复杂工程任务时,表现不够稳定。

同样受关注的还有Grok 4.5。

7月9日发布后,它进入Artificial Analysis智能指数前列,并在部分工具调用测试中表现突出,被不少开发者视为性价比较高的选择。

北城的体感与此一致,他认为Grok 4.5最大的优势是速度,同一个需求用它可能三五分钟就做完了,用GPT-5.6有时候要二十分钟甚至半小时,加上价格较低,适合有快速开发需求时使用。

姚宇航认为,Grok 4.5的编程能力经过专门优化,搭配Cursor使用整体体验很好。

一个背景是,SpaceX此前宣布收购Cursor母公司Anysphere,交易预计三季度交割;

2、混元Hy3则代表了效率路线的突破

xAI与Cursor展开的数据合作,也被认为帮助Grok 4.5优化了编程体验。

混元Hy3则代表了效率路线的突破。

该模型总参数295B、激活参数仅21B,以不到旗舰模型五分之一的参数规模,在多个公开基准中的成绩接近体量更大的竞品模型。

不过在SWE-Bench Pro中,混元Hy3的57.9分与Claude Opus 4.8的69.2分还有明显差距,说明复杂代码修复能力仍需追赶。

姚宇航认为,混元Hy3跟腾讯之前的模型相比是有进步的,加上开源和小尺寸设计,是中等体量里还不错的选择。

再看稳定在第一梯队、但惊喜有限的一类:GPT-5.6 Sol和Claude Opus 5。

GPT-5.6 Sol和Claude Opus 5依然保持第一梯队位置,但并没有带来重大变化。

GPT-5.6 Sol强化了复杂推理和智能体编程能力,在Terminal-Bench(测试模型在命令行环境中完成实际任务能力的基准)2.1测试中达到88.8%,Ultra模式进一步提升至91.9%。

Claude Opus 5则继续保持复杂任务优势,更强调模型在复杂工程、代码理解和安全分析等场景中的可靠性。

Opus 5的优势是性能接近Fable 5,而价格只有后者的一半。

四、是反馈分化与仍待验证的一类

1、但遇到特别复杂的问题时

北城提到,GPT-5.6已经能够覆盖他的大部分日常开发需求,但遇到特别复杂的问题时,会调用Opus 5来解决。

不过,更强的能力也意味着更高成本。对他而言,Opus 5的定位更接近解决关键问题时调用的“专家”。

2、是反馈分化与仍待验证的一类

最后是反馈分化、仍待验证的一类:Gemini 3.6 Flash和Qwen3.8-Max预览版。

最典型的是Gemini 3.6 Flash。

它在Artificial Analysis智能指数榜单上得分为50,与前代3.5 Flash持平。

开发者社区比较一致的反馈是,这一代相比前代没有明显提升,表现也不如同期竞品。

不过也有人认为,作为一款轻量化的模型,Gemini 3.6 Flash的输出质量基本过关。

在独立开发者卡普迪姆看来,Gemini 3.6 Flash日常使用体验不错,虽然编程能力不突出,但多模态理解仍然比较出色。

它支持输入任何格式的文件,日常聊天的文风和体验也好过很多竞品。

Qwen3.8-Max预览版在7月上线后,模型效果不稳定,市场反馈有所差异。

北城最大的感受是Qwen3.8-Max预览版的思考深度较高,但有时会陷入长时间推理,“好像自己把自己绕进去”,但最终没有给出有效解决方案。

卡普迪姆则认为Qwen3.8-Max预览版低于预期,他用自己的前端审美测评集进行测评时发现,实际能力与宣传存在明显差距。

作为一款仍在调整中的预览版产品,最终表现还需要等正式版发布后再验证。

7月没有出现一个在所有维度都领先的模型,不同模型开始围绕具体场景形成分工。

以北城为例,他会根据任务选择工具:GPT-5.6负责日常开发,Grok 4.5用于快速完成需求,Kimi K3用来做产品和前端场景,Claude Opus 5负责解决复杂问题。

卡普迪姆的搭配则不同,他会使用Claude的Fable 5或Opus 5模型进行规划,再通过GPT-5.6 Sol执行。

这轮密集发布背后,有几个问题值得分析:模型迭代为什么越来越快,为什么集中发生在7月,以及开源为什么会冲击现有的商业模式。

首先,模型迭代方式正在发生变化。过去,大模型能力提升主要依靠重新训练更大规模模型,周期长、成本高。

但随着强化学习、后训练(在基础模型训练完成后,通过微调、强化学习等方式继续优化模型表现)等技术成熟,模型升级开始更多依赖训练后的优化。

姚宇航告诉「定焦One」,近两年模型

来源: 投中网-商业深度
产业标签 AI中国/大模型与AI Agent
赞(2) 支持本站
分享到

支持本站持续更新

如果这篇内容对你有帮助,欢迎扫码支持。

支付宝扫一扫

微信扫一扫

登录

找回密码

注册