黑鲸出水,DeepSeek下半场开始

一、DeepSeek官方终于发声

1、DeepSeek官方终于发声

8月13日傍晚,DeepSeek官方终于发声,两个重要信息发布。

其一,是DeepSeek V4 Pro正式版发布,并同步在APP、网页端和API更新上线。

用户可以通过APP或网页端选择“专家模式”使用全新的V4 Pro正式版模型,API模型名不变。

其二,有着一只黑色鲸鱼头像的“DeepSeek Harness团队”迎来首次发文,宣布Harness开发者预览版正式上线,并以MIT协议开放源代码。

如此前预告,V4 Pro正式版与官方自研Harness同步亮相,由于我们此前已经着重介绍过V4 Pro,本篇文章将重点为大家解析,DeepSeek Harness为什么有看点。

以及经过今天,DeepSeek会不会从一家模型公司,变成一家更难定义的公司。

要理解Harness为什么重要,得先理解一个反直觉的事实:在Agent时代,决定一个AI能不能干活的,不只是模型。

8月6日和11日,智能体工具公司Composio通过两次测试实验,试图证明Harness的价值。

研究者把同一个DeepSeek V4-Flash接入八种不同的Harness,也就是套在模型外面的执行系统,让它们分别完成三十项多步骤任务。

这些任务不是问答,而是要求Agent进入Gmail、Google Calendar、GitHub、Slack等真实应用,调用工具并改变应用状态,每项最长运行十五分钟,全部检查通过才算成功。

结果差距不小。完成最多的Pi Agent通过了二十项,最少的OpenCode只通过十四项;

八种Harness总共运行二百四十次,仅一百二十九次成功;三十项任务中,只有六项被所有Harness完成。

在成本方面,同样完成十六项任务的Claude Code、Codex和DeepAgents,每完成一项成功任务的估算成本分别约为0.195美元、0.081美元和0.045美元。

同一个模型,差了四倍多。

2、模型划定能力的上限与要花多少钱兑现

这意味着,模型划定能力的上限,Harness决定这份上限最终能兑现多少、要花多少钱兑现。

一项长任务跑下来,执行系统要不停地做判断,上下文里留什么、丢什么,什么时候调哪个工具,工具报错了是重试还是换路,模型说做完了到底信不信、要不要再验一遍。

任何一步处理不好,模型就算思路对,也可能在真正改文件、提交代码时功亏一篑。

二、这是DeepSeek走红以来

1、这是DeepSeek走红以来

值得一提的是,这是DeepSeek走红以来,极少数提前开放内测的项目。

多个开发者在发布前就拿到了Harness内测资格,有人内测发现,让同一个V4-Flash分别在DeepSeek Harness、Reasonix和Codex中完成同一款游戏,会跑出截然不同的结果。

这说明,当模型完全相同,执行系统提供的工具、提示词、上下文组织和执行策略,足以显著改变最终产物。

这恰恰是DeepSeek重视自研Harness的原因。

DeepSeek内部曾认为,Agent要解决持续学习问题,最终让AI加快AI研发。

顺着这条线看,Harness就不是一个外挂的编程工具,而是模型进入真实研发任务的工作台。

除此之外,一家靠低价和模型能力立足的公司,如果任务交付、失败反馈和开发者入口长期挂在别人的系统里,即便其在价格上再有优势,却决定不了一个任务究竟烧掉多少Token、要重试几次、什么时候才算真正完成。

Harness到底是什么?市面上最省事的说法是“DeepSeek版Claude Code”。但用完内测版的人普遍认为,这个定位不准确。

2、这与通常理解的插件不是一个量级

据DeepSeek官方文档,Harness的核心设计哲学是“Everything is a plugin”——一切皆插件。

它基于Cordis插件系统构建,模型、工具、技能、会话、沙箱、存储、循环、调度、UI,所有Agent能力均由插件组合而成。

开发者不需要改动Harness源码,就能在配置中选择、替换或扩展任意一项能力。

这和通常理解的插件不是一个量级。VS Code的插件是给编辑器加功能,Codex的插件是给Agent加工具;

而Harness的插件可以换掉Agent的大脑、工具箱、规则乃至整张脸。

据多位参与内测的人士透露,内测期间开发者在做插件这件事上玩疯了,“大伙都不好好内测了,跑去写插件了”,在短短几天内就出现了几百个插件——有人直接改了整个工作界面,有人用纯插件实现了“跨会话长期记忆加后台自我进化”,让模型定期回头审视自己的工作记录,把临时经验压缩成长久知识。

还有人评价称,开源社区治理可能也是DeepSeek接下来要面临的难题。

另一处关键设计是可追溯性。

Harness采用只追加(append-only)的会话日志,模型看到的一切——系统提示词、思维链、工具调用与结果、子Agent调度、每一次上下文注入都会被完整记录。

三、开发者在Trajectory视图中按来源追溯

1、开发者在Trajectory视图中按

上下文压缩不会删除原始历史,只是用替换事件改变模型此后看到的表象。

开发者可以在Trajectory视图中按来源追溯,支持恢复、分叉、检索和回放。

官方文档把这一原则概括为“模型可见,即已记录”。

这背后是一种典型的系统工程思维。

据报道,DeepSeek Harness团队负责人崔添翼本科毕业于浙江大学计算机系,曾在量化交易机构Jane Street任职九年,2026年3月加入DeepSeek,5月Harness内部立项。

高频量化交易系统的核心壁垒从来不是策略多聪明,而是极端复杂环境下的稳定执行、异常兜底、全程日志追溯和风险可控——这恰好是AI Agent从演示走向生产最缺的那块拼图。

有内测开发者用“稳如老狗”形容它跑长任务时的表现:任务断了自动存档,下次接着跑,不用从头再来。

值得注意的是,Harness没有把自己关在DeepSeek模型的围墙里。

2、作为早期预览版本

它默认支持接入Kimi、OpenAI、Anthropic、Google等近四十家大模型。

可能别家倾向于做一个现成的Agent,但DeepSeek Harness更像一套组件,开发者可以自己决定Agent应该是什么样子,怎么工作。

当然,官方保持了清醒。

公告表示,作为早期预览版本,“当前仍有许多细节有待改进和打磨,核心插件与基础接口也将在后续快速迭代”。

事实上,这次内测的媒体之一爱范儿就感叹,很难想象,以快著称的DeepSeek有一天运行一项编程任务的时间也会来到半个多小时。

v0.1的版本号也说明,这条黑鲸刚出水,远没到畅游的时候。

过去数年,大模型公司的竞争集中在参数规模和基准跑分上。

但进入2026年,头部模型的基础能力快速收敛,单次问答的差距不断缩小,价格战却愈演愈烈。

单纯卖Token的商业模式,天花板已经肉眼可见。

四、从消耗了多少算力转向完成了什么任务

行业逐渐意识到,AI产业的核心价值不在模型输出,而在场景落地——同样的Token消耗,闲聊问答价值微薄,而修复一个Bug、完成一次功能开发,可以创造数倍的商业价值。

DeepSeek的新发布,意味着其从卖算力走向交结果。

在旧模式下,客户按Token调用量付费,不管模型有没有真正解决问题;

在新模式下,付费的锚点从消耗了多少算力转向完成了什么任务。

这次DeepSeek Harness发布,广受开发者好评还在于另一重原因。

DeepSeek不定义Agent本身,而是利用开源社区的扩散能力,去推崇一种Harness方案。

这是一条更宏大,也更难的路径。

并且,Harness面对的是Claude Code和Codex已经验证过的成熟市场,后两者背靠Anthropic和OpenAI的模型迭代与商业资源,先发优势明显。

1、插件生态自发繁荣、开发者是否愿意把生

开源之后,插件生态能否自发繁荣、开发者是否愿意把生产环境托付给一个0.1版本、国内市场的付费习惯能否支撑“按结果付费”的新逻辑,都是悬而未决的问题。

DeepSeek自己也表示,核心插件和API仍将快速演进,这意味着早期接入者要承担接口变动的成本。

8月13日这一天,太平洋两岸各有一场发布。马斯克为Grok 4.6站台,称其“智能、快速且性价比极高”;

DeepSeek什么都没说,只是一味丢更新。

我们想要称其为DeepSeek“史上最具潜力项目”,不是因为它今天已经最强。

V4 Pro与sota模型仍有差距,Harness还只是v0.1的开发者预览版,涨价后的市场反应有待观察,生态建设更是长路漫漫。

潜力之所以是潜力,恰恰因为它尚未兑现。

但如果把时间线拉长,从R1到V4,从模型到Harness,DeepSeek走的每一步都踩在同一个方向上:把前沿能力压到可负担的成本,再把可负担的能力接入可落地的系统。

来源: 投中网-商业深度
产业标签 AI中国/大模型与AI Agent
赞(1) 支持本站
分享到

支持本站持续更新

如果这篇内容对你有帮助,欢迎扫码支持。

支付宝扫一扫

微信扫一扫

登录

找回密码

注册