一、有人用它跑软件工程基准
1、有人用它跑软件工程基准
8月20日,OpenRouter上多了一个叫Ox Alpha的模型,100万token上下文、支持图片和视频输入、能调用工具、免费。
随后,它被接进OpenCode、Hermes等编程Agent。
有人拿它修代码,有人用它跑软件工程基准,还有人盯着tokenizer和报错信息,试图猜出它到底是谁家的。
目前,Ox Alpha的身份还没有得到官方确认。社区最流行的猜测是,它与智谱GLM-5.x系列关系很近;
依据是tokenizer、推理模式报错和部分输出习惯的相似性。但这还只是技术分析,智谱官方目前还没有认领。
从Ox Alpha爆火,可以看到一个越来越常见的出海打法:模型先匿名上线,让海外开发者替它做第一轮测试、传播和身份鉴定。
往前翻四个月,阿里的HappyHorse(欢乐马)也是这个路数—— 没有发布会,没有公司名,直接空降到AI评测平台Artificial Analysis的Video Arena榜单上,一度把字节Seedance 2.0和快手可灵3.0挤到身后,登顶榜一。
讨论热度起来几天后,阿里确认,HappyHorse来自ATH创新团队。
今年以来,OpenRouter上接连出现了一批「Alpha」模型。
2、Pony Alpha上线
2月,Pony Alpha上线,后来被OpenRouter标注为GLM-5的早期测试版本;
3月,Hunter Alpha被小米认领为MiMo-V2-Pro的早期测试版本;
4月,Elephant Alpha上线后揭晓为蚂蚁Inclusion AI的Ling-2.6-flash。
Pony Alpha、Hunter Alpha、Elephant Alpha的模型页上,如今都留下了这段「前身」记录。
匿名测试本来就是OpenRouter长期存在的机制,OpenAI、xAI、NVIDIA等团队都曾用过类似方式。
只是从HappyHorse、Pony Alpha到Ox Alpha,中国团队越来越熟练地把海外开发者平台当成新品的第一站。
大模型出海,厂商真正要争取的并不只是一次新闻曝光,而是进入开发者的日常工作。
DeepSeek和Qwen已经在海外社区积累了不少认知,但更多中国团队仍处在「听过,但没用过」的阶段。
直接挂着公司名发布,开发者未必会专门去试;
二、排名变动本身就会成为话题
1、排名变动本身就会成为话题
一个神秘代号,加上免费、长上下文、Agent这些关键词,更容易让人点开。
HappyHorse去的是视频模型盲测榜单,排名变动本身就会成为话题;
Ox Alpha进入的是OpenRouter和OpenCode。
前者是开发者选模型、比价格的入口,后者直接连着编程Agent。
用户不需要下载新软件,也不用重新学习一套工作方式,换个模型就能让它开始读代码、跑任务。
这和过去的发布会逻辑不太一样。以前,厂商先告诉市场「我很强」,再等待用户来验证;现在,模型先被扔进开发者的工作流,用户用几天就会给出答案。
Ox Alpha上线后,海外社区很快出现了两种不太一样的声音。
一边是惊喜。
社区流传的一组DeepSWE测试中,Ox Alpha在10个软件工程任务里通过了约8个,成绩高过同场测试的几款知名模型。
2、结果回落到约63%
对一款刚上线、连开发者是谁都不知道的模型来说,这个结果足够吸引注意力。
但另一边,质疑也来得很快。10个任务只是很小的样本,每多过或少过一道题,分数都会变化10个百分点。
后来出现的更大样本社区复测,结果回落到约63%。这个数字同样不是官方审计榜单,只能作为参考。
它至少说明,匿名模型上线初期,最容易被放大的往往是小样本里的惊喜。
还有研究者拿Ox Alpha跑更偏抽象推理的INDUCTION基准,得到的结论也没那么乐观:它的成绩落后于GPT-5.6 Luna和DeepSeek V4 Pro,仅略高于Gemini 3.7 Flash;
为了得到87个可评估结果,测试者调用了551次API,期间多次遇到空回答和接口错误。
他自己也无法确认,这些问题究竟主要来自模型,还是来自OpenRouter的接入链路。
这些结果并不必然互相矛盾。
今天的Agent模型,很难只靠一张benchmark表判断好坏,模型、推理档位、工具调用、网关和具体任务,都会改变最终结果。
三、和它能不能在一个真实代码库里连续工作两个小时
1、和它能不能在一个真实代码库里连续工作
它答对一道题,和它能不能在一个真实代码库里连续工作两个小时,是两件不同的事。
开发者真正关心的是,它能不能理解项目结构,工具调用会不会出错,任务做到一半会不会停住,失败后能不能自己恢复,上下文拉长后还记不记得最初目标。
开发者也在试图找出它是谁。
由于厂商没有公开说明,社区只能从模型的行为里找线索:一句话被切成多少token,错误参数会返回什么提示,把temperature调到0后会怎样组织答案,甚至中文提示词下会不会露出某种习惯。
目前最流行的猜测是,Ox Alpha与智谱Z.ai的GLM-5.x系列关系很近。
社区发现,它的tokenizer、推理档位报错,以及部分固定条件下的输出习惯,都和GLM-5.3很接近;
Ox Alpha又支持图片和视频输入,而公开的GLM-5.3主打文本能力,这也让不少人猜测它可能是一个尚未发布的多模态变体。
这个过程本身说明了匿名发布的一个特点:匿名模型一上线,开发者社区很快就会接手后面的工作:有人跑测试,有人拆参数,有人翻报错,有人顺着token计数一路猜到模型可能出自哪家。
开发者一边当公测用户,一边也做了媒体、分析师和测试工程师的活。
2、开发者先看到的是结果
如果模型一开始就挂着OpenAI、Google、阿里或智谱的名字,用户很难完全摆脱预期。
有人会因为品牌愿意多给它几次机会,也有人会因为对某家公司的印象,连试都不想试。
匿名以后,开发者先看到的是结果:代码写得怎么样,工具会不会调错,长任务能不能做完,价格值不值得。
OpenRouter联合创始人Alex Atallah此前回顾Quasar Alpha的匿名测试时提到,平台和模型团队想看的,是用户在不知道模型开发者是谁的情况下,会怎样使用和评价它。
对模型团队来说,这能减少品牌带来的预设,也能更快拿到真实反馈。
厂商放出一个代号,用户就会开始跑benchmark、接入Agent、对比输出,甚至研究tokenizer和报错信息。
HappyHorse、Pony Alpha到Ox Alpha,都是同一个过程:模型还没正式发布,社区已经替它完成了一轮能力测试、一轮技术分析和一轮口碑传播。
从厂商角度看,这笔账很好算。
实验室里的benchmark能告诉团队模型「会不会做题」,开发者则会告诉团队模型「能不能干活」。
四、厂商与哪些信息会被记录
1、厂商与哪些信息会被记录
它在真实代码库里会不会卡住,工具调用会不会出错,长上下文拉长以后还记不记得目标,高峰期服务稳不稳定——这些问题,只有真实用户拿项目去撞,才能撞出来。
匿名测试还有一个更直接的好处:免费期里留下的使用数据,会帮助厂商判断模型应该卖给谁、该怎么定价、哪些能力值得继续投入。
对还在找产品定位的新模型来说,这比提前写好一套发布会话术更有价值。
厂商和平台知道模型是谁、服务跑在哪里、哪些信息会被记录;用户拿到的往往只有一个代号和一段有限的说明。
Reddit上就有开发者提到,匿名模型很难进入严肃的企业评估流程:公司内部的benchmark、代码和业务数据都涉及合规,等走完审批,模型可能已经下线了。
对个人开发者来说,这是一份免费的惊喜;对企业来说,更像一份没有署名、也没有完整说明书的试用品。
Ox Alpha把这个问题放大得更明显。
OpenRouter的页面写明,提示词和输出会由上游提供商保留,但不会用于训练;
2、OpenCode的相关说明则强调零数
OpenCode的相关说明则强调零数据留存。两种说法并不完全一致。对只是试玩的用户,这可能只是条款差异;
对准备上传代码和业务文档的团队来说,它直接决定了能不能接入。
还有一个容易被忽略的问题:真实公测测出来的,从来不只是一款模型的能力。
研究者Serafim Batzoglou在INDUCTION基准上测试Ox Alpha时,遇到了大量空回答和API错误。
为了获得87个可评估结果,他一共调用了551次API。
他的困惑很有代表性:问题究竟出在模型,还是出在OpenRouter的接入链路?
对最终用户来说,这个问题其实没有那么重要——模型能不能稳定工作,本来就是产品能力的一部分。
匿名发布,确实给了模型一个摆脱品牌滤镜的机会,也让厂商能更早看到真实世界的反馈。
但厂商拿到真实数据的同时,用户也承担了更多判断成本:要自己猜身份,自己判断能力,自己核对数据政策,还要自己承担服务不稳定的风险。

远见网
