Ox Alpha 选题:标题、切入角度与 Agent 面试题
Ox Alpha 选题:标题、切入角度与 Agent 面试题
今天是 2026 年 8 月 24 日。Ox Alpha 的免费期写明到 8 月 27 日,只剩三天,这是目前手上时效性最强的选题。
零、一个前提:归属只是猜测,不能当事实写
Ox Alpha 是以 stealth/ox-alpha 的名义挂在 OpenRouter 上的匿名模型,OpenRouter 明确声明自己只做路由,不是开发者也不是所有者。目前指向智谱 GLM-5.x 的说法来自独立研究者 Ben Davis 的分析,他自己给的措辞是 99% 确定,但这依然是第三方推断,没有任何一家公司承认。
所以这篇不能用员工体。写成「智谱员工:Ox Alpha 就是我们做的」属于虚构内部人表态,一旦被打脸,你这个系列的可信度就没了。你已发布的 11 篇里,第 10 篇 DeepSeek 和第 11 篇腾讯 offer 那两条本来就不是严格的员工体,这一篇按同样的路子走——用事件本身当主语,把猜测明确标成猜测。
一、标题
推荐这三条,都在 55 到 65 字。
一个匿名模型突然出现在 OpenRouter,1M 上下文限时免费,有人扒出它的分词器和 GLM-5.3 一模一样,只多了 75 个 token(附Agent面试题)Ox Alpha 上线几天就被扒了个底朝天:DeepSWE 拿到 80%,视频 token 消耗和 GLM-5V-Turbo 完全一致,社区已经猜到是谁家的了(附Agent面试题)免费到 8 月 27 号的匿名模型 Ox Alpha,Hermes Agent 和 Zed 都接了,但它的条款写着你的 prompt 会被提供方保留(附Agent面试题)第一条最稳,事实密度最高,「只多了 75 个 token」这个细节是最好的钩子,具体到让人必须点进来看。
第二条冲击力最强,但「社区已经猜到是谁家的了」这句要在正文第一段就说清是推断不是官方确认。
第三条是我认为对读者最有价值的角度——免费的代价。如果你想做一篇有观点而不只是追热点的文章,选这条。
二、事实素材
- 发布:2026 年 8 月 20 日上线 OpenRouter,标识为 stealth/ox-alpha,同期也在 OpenCode Zen 上线
- 上下文:1,048,576 tokens(1M),最大输出 131,072 tokens
- 定价:免费预览期到 2026 年 8 月 27 日,之后定价未公布
- 定位:官方描述为推理模型,面向编码、持续代理工作和生产负载
- 多模态:支持文本、图像、视频输入,支持工具调用和结构化 JSON 输出
- 性能:平均延迟 5.74 秒,吞吐 23 tokens/s,可用性 99.98%
- 跑分:DeepSWE 80% Pass@1,对比口径 Claude 65%、GPT-5.6 52%。注意这些来自不同测试框架且样本量小,属于初步指标而非确定排名,引用时必须标注
- 数据政策:按 Stealth Model Terms,prompt 和 completion 由提供方保留,声明不用于训练
- 生态:已被接入 Nous Research 的 Hermes Agent、Zed 编辑器
- 归属推断的四条证据(均出自第三方分析,非官方):
- 视频编码器的 token 消耗模式与 GLM-5V-Turbo 完全一致
- 分词器 token 计数与 GLM-5.3 完全吻合,只多出一个固定的 75 token 隐藏 wrapper
- 对音频输入的拒绝行为与 GLM-5V 一致
- 输出风格约每千字符 1.3 个 emoji,符合 GLM/Qwen 系列的模式
三、主题怎么切
我建议主线走「技术侦探」,副线走「免费的代价」。
主线:一个匿名模型是怎么被指纹识别出来的
这是程序员最吃的一类内容,因为它教的是方法而不是结论。四条证据里最硬的是分词器——同一段文本喂给不同模型,token 数完全一致的概率极低,因为分词器是训练时就定死的。而那个固定的 +75 token 隐藏 wrapper,说明服务方在用户输入前面注入了一段系统提示,这本身也是个可以展开讲的点。
写的时候把方法讲清楚:怎么设计探针文本、怎么对比 token 计数、怎么观察拒绝行为的边界、怎么统计输出风格。读者看完能自己去验证,这篇文章的价值就成立了。
副线:免费背后的账
Stealth 模型这种发布方式,本质是厂商把社区当成免费的大规模评测场。开发者拿到免费额度,厂商拿到真实场景的压测数据和口碑。条款里写明 prompt 会被保留但不用于训练,这个承诺在工程上是无法验证的,所以真正的问题不是信不信,而是你把什么样的代码喂进去了。
再加上 8 月 27 日之后定价未知,任何把它接进生产链路的团队都在承担一个随时会变的成本和随时会消失的依赖。这一段可以直接连到你的面试题。
结尾的观点
可以落在一句话上:现在选模型,能力已经不是第一位的门槛了,能不能锁版本、能不能查数据流向、能不能在三天内换掉,才是。
四、Agent 面试题(12 题 + 1 道场景题)
01、给你一个不知道来历的模型 API,你怎么判断它可能是哪个家族的?
答题要点:从确定性最高的信号往下排。第一是分词器指纹,构造一批包含罕见字符、多语言混排、连续空格和 emoji 的探针文本,比较 token 计数,分词器在训练时固定,不同家族几乎不可能完全一致。第二是特殊 token 和模板痕迹,观察是否存在固定的额外 token 开销,那通常是被注入的系统提示。第三是拒绝行为的边界,各家的安全策略差异很大,对同一批边界问题的拒绝措辞和拒绝范围很有辨识度。第四是输出风格统计,emoji 密度、markdown 习惯、列表偏好、中英混排方式。最后是能力边缘,比如支不支持某种模态、对某类格式的处理方式。要强调的是单一证据不足以下结论,需要多条独立信号相互印证。
02、发现请求里多出一段固定长度的 token 开销,你会怎么理解和处理?
答题要点:固定的额外 token 说明服务方在你的输入前后注入了内容,通常是系统提示或安全指令。影响有三:一是成本,每次请求都要为这段内容付费;二是行为,注入的指令可能与你自己的系统提示冲突,导致模型不完全听你的;三是缓存,如果注入内容稳定,它反而有利于前缀缓存命中。处理上,先通过对照实验确认这段开销是固定的还是随输入变化的,再测试自己的系统提示能在多大程度上覆盖它。生产环境要把这部分开销计入成本模型,不能按裸 token 数估算。
03、一个模型宣称 1M 上下文,怎么验证它的有效上下文到底有多长?
答题要点:标称长度和有效长度是两回事。验证方法分几层。最基础的是大海捞针,在不同深度插入特定信息再提问,画出准确率随位置和总长度变化的曲线,通常会看到中间段明显塌陷。进阶的是多针测试,同时插入多条相关信息要求综合,考察的是跨片段推理而不只是检索。再进一步是长上下文下的指令遵循,把约束放在最前面,看在 80 万 token 之后模型还记不记得。还要测成本和延迟随长度的变化曲线,很多模型在标称长度附近延迟会急剧劣化,工程上根本不可用。结论应该是给出一个建议工作区间,而不是照抄标称值。
04、跨测试框架的 benchmark 分数能不能直接比?
答题要点:不能。同一个 benchmark 在不同框架下,提示模板、工具集、最大步数、超时设置、重试策略、评分脚本都可能不同,其中任何一项都能造成十几个百分点的差异。Agent 类基准尤其敏感,因为它是多步的,Harness 强弱对结果的影响可能大过模型本身。判断一组对比是否可信,要看是否同一框架同一时间跑的、是否公开了完整配置、样本量多大、是否报告了方差。实践中更可靠的做法是自建评测集,在完全相同的 Harness 下横向跑所有候选模型,只比自己关心的场景。
05、把一个匿名的、来历不明的模型接进生产环境,风险有哪些?
答题要点:至少五类。身份风险,不知道提供方是谁,出问题找不到责任主体。数据风险,条款说保留但不用于训练,这个承诺无法从外部验证,代码、密钥、业务逻辑一旦送出去就收不回。定价风险,免费期结束后价格未知,可能一夜之间从零变成不可接受。可用性风险,没有 SLA,随时可能下线或限流。合规风险,数据流向不明,很多行业的合规要求直接禁止。结论应该是:可以用于评估和非敏感场景,绝不接入涉及生产代码和用户数据的链路,且必须有随时切换的能力。
06、免费期只剩三天,之后要换模型,你的系统需要提前做什么?
答题要点:核心是供应商抽象层。需要抽象的差异包括:请求与响应格式、工具调用的 schema 和返回约定、思考过程字段的有无与格式、流式协议、缓存语义、错误码与限流行为、以及 token 计数方式。抽象层之上,业务代码只面对统一接口。除此之外还要准备三样东西:一套自建的回归评测集,用来量化换模型后的行为漂移;影子流量机制,新旧模型并行跑一段时间对比结果;以及配置化的模型选择,切换不需要发版。做到这三点,换模型才是分钟级而不是周级。
07、条款写着 prompt 会被保留但不用于训练,工程上怎么防护?
答题要点:既然无法验证,就按最坏情况设计。第一层是数据分级,明确哪些内容绝对不能出网,比如密钥、个人信息、核心算法。第二层是出站过滤,在请求发出前做敏感信息检测和脱敏,密钥类可以用正则加熵值检测,业务标识可以做映射替换,返回后再映射回来。第三层是最小化上下文,只发必要的代码片段而不是整个文件或整个仓库。第四层是审计,记录每一次出站的内容摘要,事后可追溯。要补充的是,脱敏和 Agent 的效果是有冲突的,脱得越干净模型理解得越差,这个权衡要在设计时就想清楚,而不是出事后再补。
08、延迟 5.74 秒、吞吐 23 tokens/s 的模型,适合放在 Agent 循环的哪个位置?
答题要点:先算账。一个典型的 Agent 任务要跑十到几十轮,每轮 6 秒起步,加上生成时间,一个任务几分钟到十几分钟。这样的模型不适合放在需要用户等待的交互链路,适合放在异步的、后台的、长任务场景。工程上的做法是分层:交互层用快模型做意图理解和即时反馈,规划和难点决策交给这类慢而强的模型,执行层再换回快模型。同时要把长任务做成可中断可续跑的,用户提交后可以离开,完成后通知。如果一定要放在交互链路,就必须做流式输出加进度提示,让用户感知到在动。
09、多模态模型支持视频输入,视频的 token 消耗怎么估算和控制?
答题要点:视频本质是按帧采样后走视觉编码器,token 消耗大致等于帧数乘以每帧 token 数,而每帧 token 数又与分辨率相关。所以控制手段有三个:降低采样帧率,大部分场景每秒一帧甚至更低就够;降低分辨率,识别文字和识别动作对分辨率的要求差很多;做关键帧选择,用轻量的画面变化检测跳过静止片段。工程上要在发送前就估算好 token 量并设上限,因为视频很容易一次请求就把上下文撑满。另外要注意,视频 token 的消耗模式是模型指纹的一部分,不同家族的编码方式差异明显。
10、怎么保证模型的结构化 JSON 输出可靠?
答题要点:不要只依赖提示词要求。可用手段按可靠性排序:优先用模型原生的结构化输出或工具调用能力,由服务端做约束解码;其次用 JSON Schema 校验加自动重试,把校验错误信息回传给模型让它修;再次是容错解析,处理常见的markdown 代码块包裹、尾随逗号、单引号等问题。设计 schema 时要尽量扁平、字段名语义明确、枚举值少而清晰,深层嵌套和自由格式字段的失败率明显更高。最后要有监控,统计解析失败率,这个指标对模型版本变化非常敏感,是发现上游静默更新的好探针。
11、怎么给一个刚出现的新模型快速做能力画像?
答题要点:目标是在几小时内判断值不值得深入。做法是准备一套标准探针,覆盖几个维度:指令遵循,给出复杂的多条约束看是否全部满足;长上下文,做一轮大海捞针;工具调用,给几个易混淆的工具看选择是否正确、参数是否填全;错误恢复,故意让工具返回错误看是否会换策略还是原地重试;停止判断,给一个已经完成的任务看会不会画蛇添足;格式稳定性,同一请求跑多次看输出结构是否一致。每个维度十几个用例即可,重点是这套探针要固定复用,这样所有模型的画像可以横向比较,且能积累出你自己的判断基线。
12、免费的匿名模型大规模开放,厂商图什么?
答题要点:这是产品和工程混合的题。厂商拿到的是三样东西:真实分布的压测流量,实验室里造不出来的场景多样性;无偏的口碑,用户不知道是谁家的,评价不受品牌滤镜影响,这是最值钱的部分;以及大规模的稳定性验证,99.98% 可用性这类数字必须靠真实流量才跑得出来。开发者拿到的是免费额度和尝鲜机会。这个交换本身是公平的,问题在于信息不对称:开发者不知道自己的数据去了哪里。工程上的启示是,评估新模型应该用专门的沙箱环境和脱敏数据,而不是拿生产任务去试。
场景题:你所在的团队想在三天内评估要不要采用一个新出现的模型,你怎么安排?
答题要点:第一天做能力画像,跑标准探针加自建回归评测集,和现有模型在同一 Harness 下横向对比,产出一张能力和成本的对照表。第二天做工程验证,接进抽象层跑影子流量,观察真实任务的成功率、平均步数、格式失败率、延迟分布,重点看 P99 而不是均值。第三天做风险评估,梳理数据流向和条款、确认定价和 SLA、验证切换成本,同时准备回滚方案。最后给出的结论不应该是用或不用,而是分场景的建议:哪些场景可以上、哪些必须等、以及需要满足什么条件才重新评估。能提到三天内不可能评估完长期稳定性、所以结论要带有效期,是加分项。
五、发布前核验
来源
- OpenRouter Ox Alpha 模型页:https://openrouter.ai/stealth/ox-alpha
- Local AI Zone 技术分析:https://local-ai-zone.github.io/blog/ox-alpha-stealth-model-comprehensive-analysis.html
- SegmentFault 实测与接入指南:https://segmentfault.com/a/1190000048187129
- EOGEE OpenRouter 与 OpenCode Zen 同步上线:https://eogee.com/article/80
- Bloomberg 报道:https://www.bloomberg.com/news/articles/2026-08-23/mystery-ai-model-ox-alpha-draws-developers-with-free-access
