OX / ALPHA
REDDIT × X / LAUNCH INTELLIGENCE / 2026.08

匿名六日,
一场被共同放大的猜谜。

免费高额度带来试用,跑分与作品带来惊讶,身份悬念延长讨论。直到 8 月 26 日,“牛来”才与智谱 GLM-5.3-Flash 正式合流。

事件:08.20 — 08.26 · 采集:2026.09.22
33 条精选主帖 / 全部可回溯 / 时间统一 UTC
8.5MOpenCode 首发帖浏览
6.9MZ.ai 认领帖浏览
726 / 250早期 Reddit 爆帖 · 分 / 评论
80% → ≈63%跑分叙事校准 · 均为子集

热度为 9 月 22 日所见累计快照,含事后增长;不代表事件当天峰值。X 浏览与 Reddit 净分不能直接比较。未推算独立触达或付费转化。

THE SIX-DAY ARC

沿着五个阶段,回到现场。

点击阶段查看分析;下方帖子库可独立筛选
X · 发布入口

OpenCode / OpenRouter

Reddit · 首批体验

免费、额度与 ZDR 质疑

X · 性能证据

Ben / demo / Cline

Reddit · 二次标题

“超越 Fable”及样本争论

X · 猜谜汇总

Andrew / Evan / 更正

Reddit · 技术侦探

GLM 指纹 vs Gemini 猜测

X · 使用规模

26T / 8T 日用量

Reddit · 使用分化

能力认可、慢与异常停止

X · 品牌合流

Z.ai / 生态接入 / 成本

Reddit · 认领回看

开放权重与误导争议

HIGH-VISIBILITY POSTS

谁把话题推得更远?

各平台分开排序 · 已核实样本内 Top 5

X · 按浏览量

Reddit · 按净分

最值得追踪的并非只有“爆款”。r/opencode 的体验帖只有 19 分,却有 84 条评论;它保留了速度、稳定性、编排与代码实现之间的真实分歧。高浏览不等于好评,高用量也不等于高成功率。
SOURCE LIBRARY / 33 POSTS

热门内容与关键证据库

OBSERVED CONNECTIONS

能证实的是引用关系,不能臆测的是幕后安排。

OpenCode 首发Ben 10 题跑分Reddit 726 分帖

原帖直接引用与链接:可用供给 → 惊讶的数字 → 标题传播。传播过程中,小样本限定被弱化。

Evan 模糊表达Gemini 猜测认领后争议

Reddit 原帖链接两条 X 内容。社区的确定性措辞强于原作者声明;误读本身又成为内容。

四个环节共同作用

① 工具内免费入口,缩短“看到 → 试用”。
② 跑分与 demo,为开发者提供转发素材。
③ 匿名与多候选,让测试同时成为侦探游戏。
④ 官方与伙伴同步承接,把 Ox 名称迁移到 GLM。

以上为研究归纳。没有足够证据证明付费 KOL 安排、投放预算、组织化评论或商业转化率。

EVIDENCE, NOT HYPE

复盘时,别把这些数字写错。

100T ≠ 实际日用量

它是 OpenCode 宣称的日容量;四天 26T、六天 42T 才是其累计用量口径。

42T + 20T 不能简单相加

分别来自 OpenCode 与 OpenRouter。统计范围、路由与重叠未知,不能当作独立总量。

80% 与 63% 都有边界

前者仅 10 题;后者为更大子集。原作者的澄清并未宣称完整基准。

技术指纹 ≠ 精确身份

同 tokenizer 支持 GLM 血缘,但无法单独排除第三方后训练或确定版本。

认领是一个过程

06:28 社区泄露式确认;11:14 媒体报道转播;14:12 官方 X 主帖。均为 8 月 26 日 UTC。

匿名热度 ≠ 付费留存

免费结束后的限量落差已在评论出现;实际流失、留存与营收没有可验证数据。

展开完整研究文档 · 阶段分析、33 条档案与证据边界

牛来 Ox Alpha|Reddit × X 匿名发布传播复盘

从免费试用到身份猜谜,再到智谱认领

研究窗口:2026-08-20 至 2026-08-27(核心事件集中 20–26 日);采集日:2026-09-22。时间统一为 UTC,北京时间加 8 小时;例如 8 月 20 日 20:59 UTC 对应北京时间 8 月 21 日 04:59。X 日期按帖子 ID 时间戳与页面日期交叉核对,Reddit 读取页面 time 字段。浏览量、分数和评论数均为采集时点快照,含事件后增长,不是当天峰值。

一、结论先行

Ox Alpha 的发酵由“可立即使用的免费供给”启动,经小样本跑分与可视化作品扩散,再由身份悬念、社区技术鉴定和平台用量反复放大,最终在 8 月 26 日被智谱认领为 GLM-5.3-Flash。X 更像分发与背书网络,Reddit 更像复测、质疑和身份辩论的讨论场;两者通过可核实的引用链接相互放大。

  • 最大的样本入口是 OpenCode 首发:约 850 万浏览;不是先由智谱账号打响。[X01]
  • 最容易被误传的内容是跑分:10 题 80% 经标题简化为“超越”,原作者随后更正约 63%。[X03] [R02] [X12]
  • GLM 技术线索出现很早:8 月 21 日已存在,仍未压过后续 Gemini 猜测。[R04] [R06]
  • 认领形成新的传播高点:Z.ai 主帖约 690 万浏览,但无法由快照还原日流量曲线或付费转化。[X18]

二、五阶段全过程

1. 08.20|匿名上线:免费额度先于品牌

OpenCode 与 OpenRouter 几乎同时公开。OpenCode 用“免费一周、1M、多模态、ZDR、100T/日容量”给出强试用理由;OpenRouter 则以匿名 frontier model 和生产任务定位提供入口。首批 Reddit 帖已经在讨论谁有能力承担这种成本,以及 ZDR 是否可信。

最早核实的两个 X 发布节点相隔约 2 分 27 秒,显示渠道上线高度同步,但不能据此推断全部社区内容由品牌策划。OpenCode 的首发浏览量约 850 万,超过 OpenRouter 约 210 万;在本样本中,开发工具的可用性承诺是更大的注意力入口。

关键原帖:[X01] [X02] [R01]

2. 08.21|能力证明:跑分与 demo 把试用变成谈资

Ben Davis 用 10 道 DeepSWE 任务得到 80%,对比数字形成极强标题。r/singularity 随即直接链接该帖,并改写成“outperforming Fable on SWE”;该帖获得 726 分、250 评论。流体模拟、SVG 和 bug 发现等具体结果,把模型优势变成容易展示、讨论和复测的内容。

Cline 接入(约 65.5 万浏览)和 Patrick Collison 背书(约 30.3 万)进一步扩大可见度。与此同时,OpenCode 已公开承认网络错误与异常停止并推出重试修补。正面 demo 和产品摩擦从第一天就共存,并非后来才出现反面声音。

关键原帖:[X03] [R02] [X04] [X09] [X08] [X06]

3. 08.21–23|猜测与纠偏:技术指纹没能结束猜谜

8 月 21 日,FlunkyGraphics 发出 tokenizer 固定 +75 token、报错字符串、temp-0 输出等指纹;yunes87 又给出 14 组探针和 API 行为复现材料。它们指向 GLM 家族,却不能单独排除别的实验室基于 GLM 继续训练。Andrew Curran 同时建立汇总串,容纳不同身份推测。

8 月 22 日,Evan Otero 的“Gemini”与 Ox 玩笑被 Reddit 解读为 Google 新模型;相关 X 玩笑约 140 万浏览,Reddit 帖 283 分。另一篇“不是中国模型”帖 394 分、174 评论,围绕拒答/过滤展开争执。Ben 同日将 80% 校准为约 63%,并在跟帖强调这仍是更大子集。8 月 23 日 TechCrunch 引用 Patrick、Andrew 和对立的 Reddit 帖,令“身份谜题”本身成为新闻。

关键原帖:[R04] [R05] [X05] [X10] [X11] [R06] [R07] [X12]

4. 08.23–25|规模放大:使用量成为第二条新闻线

OpenCode 8 月 24 日公布四天 26T;OpenRouter 同日公布 8T/日,并转发基于 Discord 讨论的社区总结。Rohan Paul 再把用量解释为 coding agents 的长上下文与多次调用。平台不再只推广模型能力,而是推广“大家都在用”的采用叙事。

用户体验并未收敛为全盘好评。r/opencode 的 84 评论讨论指出慢、异常停止、实现错误,同时有用户看好编排和审查。Paweł 的两个仓库 bug hunt 得到 16/105,明显低于其对照模型。合理结论是:免费放大了任务量与讨论量,但不能证明整体任务成功率或付费留存。

关键原帖:[X13] [X14] [X15] [R08] [X16]

5. 08.26|认领与承接:从悬念揭晓,转向成本与开源

当日 06:28 UTC,r/LocalLLaMA 已出现引用随后删除的 Roman X 帖的“First serious confirmation”;11:14 UTC,r/singularity 转引 Bloomberg 获得智谱确认的报道。Z.ai 于 14:12 UTC 正式发布,OpenRouter 约两分钟后确认 Ox 就是 GLM-5.3-Flash。官方主帖约 690 万浏览,形成明确的品牌归因节点。

官方把匿名期间的好评与 320B/18B、MIT、1M、多模态、中国 AI 芯片等信息一起发布。OpenCode 转入 Go 限时双倍额度;Cline 延续免费并称占流量逾 11%;Artificial Analysis 把讨论推向单位任务成本。同时,Reddit 对 Google 相关模糊发帖产生争议,OpenCode 评论表达免费结束后的落差。认领既承接品牌,也重置用户的价格预期。

关键原帖:[R09] [R10] [X17] [X18] [X19] [X20] [X21] [X22] [R11]

三、认领日的精确顺序

8 月 26 日 UTC事件证据
06:28LocalLLaMA 引用 Roman 的提前发布帖;原 X 后来删除。[R09]
09:56OpenCode 用 42T / 六天预告几小时后揭晓。[X17]
11:14singularity 已转引 Bloomberg 对智谱确认的报道。[R10]
14:12Z.ai 正式发布,明确此前以 Ox Alpha 预览。[X18]
14:14OpenRouter 同步认领并承接正式模型入口。[X19]
14:34OpenCode Go 公布限时双倍额度。[X20]
17:20–17:31Artificial Analysis 评测与 Cline 流量/免费入口跟进。[X21] [X22]
20:28Bard 社区讨论此前 Google 相关模糊发帖是否误导。[R11]

这是已核实节点的顺序,不将 Reddit 发帖时间当成 Bloomberg 首发时间,也不把被删帖当作官方认领。

四、哪些传播链有直接证据?

  1. OpenCode → Ben Davis → r/singularity:Ben 的 X 帖直接引用 OpenCode 首发;726 分 Reddit 帖直接链接 Ben。可核实的“供给入口 → 性能惊讶 → 跨平台标题扩散”。[X01] [X03] [R02]
  2. OpenRouter → Patrick / Andrew → TechCrunch:Patrick 与 Andrew 引用平台首发;TechCrunch 8 月 23 日再引用二人以及 Reddit 对立观点。证明新闻报道采纳了社交讨论,不证明由谁主导策划。[X02] [X08] [X05] [R07] [M01 TechCrunch]
  3. Evan 的 X → Gemini 猜测帖 → 认领后争议:R06 明确嵌入两条 Evan 原帖,R11 在认领后回看模糊表达。它是话题扩张与信任消耗并存的例子。[X10] [X11] [R06] [R11]
  4. Z.ai → OpenRouter / OpenCode / Cline:伙伴用“formerly Ox Alpha”或引用官方帖,把匿名模型的已知名称接到正式产品。时间和文字关系可验证,后台协调机制及付费关系未知。[X18] [X19] [X20] [X22]

五、Reddit 与 X 的分工

维度XReddit
入口OpenCode、OpenRouter、Cline 提供明确试用方式工具社区把试用信息转为问题和体验帖
内容形态短数字、demo、名人一句话、猜测串长线程、黑盒技术测试、互相反驳、场景化反馈
放大机制引用转发把发布者、开发工具、评测者连起来争议标题吸引讨论,评论补充证据与反证
主要风险限定条件被省略、模糊表达被当成内部消息国别与品牌猜测偏离技术;评论热度被误读为赞同
揭晓以后价格、开放权重、生态接入与用量占比身份确认、部署尺寸、付费落差与此前暗示的声誉争议

这些是对所采集内容形态的归纳,不是两平台整体用户行为的统计定律。r/singularity 的早期爆帖 726 分/250 评论、r/opencode 的体验帖 19 分/84 评论,表明“高赞新闻”和“低分但深入讨论”应同时纳入。[R02] [R08]

六、讨论并非一边倒

  • 能力惊喜:流体模拟、SVG、发现 bug、长任务编排带来展示性素材。演示容易传播,但不能代表综合性能。[X04] [R02] [R08]
  • 推理与实现分化:部分使用者认为适合 planner / reviewer,却在实际实现中出现幻觉或反复修错。[R08] [X16]
  • 速度与稳定性:慢、停止、重试贯穿匿名期;平台升级也间接证实体验问题存在。无法仅凭评论区分模型、服务端负载与 harness 的责任。[X06] [R08]
  • 隐私与免费动机:首日即出现对 ZDR 与巨额免费供给的怀疑。记录这种怀疑,但没有证据证明数据承诺遭违反。[R01] [X01]
  • 揭晓后的落差:身份谜题结束,不代表商业转化已完成;限量/付费带来新阻力。[X20] [R11]

七、需要纠正的九个口径

常见说法可支持的表述原帖
80% 跑分10 道 DeepSWE 任务子集;作者随后转引更大子集约 63%。两者都不能写作完整官方基准。[X03] [X12]
100T tokens/dayOpenCode 宣称的每日供给容量;不是实际消耗量,也不是用户数。[X01]
42T 与 >20T分别为 OpenCode 与 OpenRouter 六天累计口径,存在路由/统计重叠的不确定性,不能相加为独立总量。[X17] [X19]
Google / Gemini 暗示原帖是单词与玩笑;归属结论由社区解读产生,最终被智谱认领推翻。[X10] [X11] [R06]
tokenizer 相同支持家族血缘,不单独证明精确版本或开发主体;14 组探针中 5.2 与 5.3 都匹配。[R04] [R05]
ZDR / 不训练OpenCode 声称 ZDR;OpenRouter 跟帖说不使用 prompts/completions 训练。二者不是同一概念,本研究未审计。[X01] [X02]
官方认领的时间媒体确认/社区泄露在官方 X 主帖之前;应把 8 月 26 日拆成多个节点。[R09] [R10] [X18]
小模型能本地跑320B 总参数、18B 激活不等于只有 18B 权重;不能由激活参数推断普通机器可运行。[X18]
AA 的 400k 上下文评测串跟帖已更正为 1M;其缓存价格不同段落也不一致,产品信息优先采用官方披露。[X21] [X18]

八、对模型发布的启示(研究推论)

有效的组合是可用性、可展示成果、公共悬念和认领承接。匿名本身不能解释热度;没有免费高额度与 coding agent 入口,猜谜很难产生同等规模的实际体验。将此复盘用于其他发布,应优先复制“低摩擦试用 + 可复现评测 + 生态渠道”,而不是复制含糊暗示。

  1. 上线:模型描述、隐私承诺、额度和入口统一;衡量实际任务成功数,不只数 token。
  2. 验证:可视化 demo 配提示词、版本、失败案例;小样本分数必须保留分母,纠偏链接回原帖。
  3. 扩散:支持社区做可复现技术验证;不要将员工模糊发言制造的误读当作可靠传播资产。
  4. 认领:旧别名、正式名称、API 路径、权重、价格与迁移步骤同时交付,减少“知道真身却找不到入口”。
  5. 转化:单独追踪免费结束后的留存、付费任务成本、成功率与服务稳定性。公开热度无法替代这些指标。

未发现足以确认付费 KOL 名单、组织化灌水、预算、全渠道触达或转化率的可靠证据。不能把时间接近或正面评价自动判作品牌投放。

九、各阶段原帖档案(33 条)

每条包含时间、可核验热度、中文解读与证据边界。X 仅采用明确标注的浏览量与回复数,不解析抓取文本中黏连的点赞/转发数字。Reddit 分数是净分,可能经过平台模糊化;不是点赞人数。

阶段 1 · 匿名上线

X01|首发:免费一周,100T/日容量

opencode · 2026-08-20 20:59 UTC · 8,500,000 浏览 / 827 回复

打开原帖

内容:公布 1M 上下文、多模态、Zero Data Retention、近乎不限量的免费一周试用。

传播作用:把抽象的新模型变成开发者当下能用的福利;本样本浏览量最高的 X 帖。

边界:100T 是平台宣称的每日容量,不是实际日用量;ZDR 是平台承诺,本研究未独立审计。

We have capacity for 100T tokens per day

X02|首发:匿名 frontier coding model

OpenRouter · 2026-08-20 21:02 UTC · 2,100,000 浏览 / 230 回复

打开原帖

内容:以 stealth 身份上架,定位持续 agent 工作与生产任务;1M 上下文,文本、图像、视频输入。

传播作用:聚合平台提供分发和可信入口;后续 Patrick 与 Andrew 均直接引用此帖。

边界:frontier 是发布方定位,不等于独立评测结论。

New stealth model: Ox Alpha

R01|Guess what? Another one free model - Ox Alpha - in Opencode... :)

u/afanasenka · r/opencodeCLI · 2026-08-20 21:02 UTC · 237 分 / 88 评论

打开原帖

内容:首批社区发现帖;回复围绕免费、ZDR 是否可信和 MiMo/Hy4/GLM 等候选展开。

传播作用:免费入口迅速产生自发讨论,也同时引出隐私与成本疑问。

边界:评论怀疑收集数据只是用户质疑,不能认定实际发生。

阶段 2 · 能力证明

X03|10 道任务跑出 80%,引发性能惊讶

davis7 · 2026-08-21 04:20 UTC · 901,000 浏览 / 200 回复

打开原帖

内容:Ben Davis 公布 DeepSWE 的 10 任务子集结果:Ox 80%、Fable 65%、GPT-5.6-Sol 52%。

传播作用:直接被 r/singularity 的 726 分热帖链接;是可核实的 X → Reddit 转播链。

边界:作者首帖已写明小样本与高方差。不能称完整 SWE/DeepSWE 排名。

I ran this thing through 10 tasks on DeepSWE

R02|A stealth model called Ox-Alpha has been released, outperforming Fable on SWE.

u/troll_khan · r/singularity · 2026-08-21 06:20 UTC · 726 分 / 250 评论

打开原帖

内容:直接链接 Ben 的 10 题跑分帖;评论展示 SVG、bug 发现等测试,也指出小样本问题。

传播作用:本次已核实 Reddit 样本最高分、最多评论的帖子;“超越”标题比原始限定条件更强。

边界:标题不能作性能事实;原始 80% 已被作者校准。

R03|New Stealth Model on OpenRouter: ox-alpha (80% on DeepSWE subset)

u/Pyros-SD-Models · r/accelerate · 2026-08-21 09:44 UTC · 119 分 / 40 评论

打开原帖

内容:以 80% 子集成绩做标题,正文已提视频 tokenizer 像 GLM。

传播作用:成绩传播和身份推理从一开始就并行,不是先火后猜。

边界:链接的技术分析未被本研究复现;标题明确是 subset。

X04|单 HTML 流体模拟:视觉作品传播

scaling01 · 2026-08-21 11:47 UTC · 249,900 浏览 / 64 回复

打开原帖

内容:展示声称一次生成的 1000 行 GPU 加速流体模拟,表达强烈惊喜。

传播作用:可视化 demo 降低理解成本,被 Andrew 的汇总串引用。

边界:“1000x better”是夸张评价;评论指出与既有开源模拟相似,不能证明原创或通用能力。

Ox Alpha one-shotted the GPU accelerated fluid simulation

X06|官方处理异常中断与网络错误

opencode · 2026-08-21 14:51 UTC · 344,000 浏览 / 135 回复

打开原帖

内容:建议升级 OpenCode 1.18.21,以自动重试未知停止。

传播作用:证明免费体验存在实际摩擦,平台快速修补帮助维持试用。

边界:客户端重试不等于模型或服务端问题已全部解决。

X07|更大 DeepSWE 子集约 63%

winkey_h · 2026-08-21 14:52 UTC · 196,500 浏览 / 32 回复

打开原帖

内容:Wenqi/Kevin 报告约 63% 与平均 47K 输出 token。

传播作用:提供比“10 题 80%”更稳健的校准点;后续 Ben 明确引用。

边界:仍为子集;不能将 63% 包装成官方完整榜单结果。

X08|Patrick Collison:very impressive

patrickc · 2026-08-21 16:08 UTC · 302,600 浏览 / 58 回复

打开原帖

内容:分享用 ori 调用 stealth/ox-alpha 的命令,给出简短正面评价。

传播作用:Stripe CEO 的背书为技术话题增加商业圈可见度;被 TechCrunch 引用。

边界:TechCrunch 同文提及 Stripe 与 OpenRouter 的收购关联,不能视为完全无关利益方的独立测试。

It’s very impressive.

X09|Cline 免费接入并展示早期跑分

cline · 2026-08-21 17:31 UTC · 654,700 浏览 / 97 回复

打开原帖

内容:提供 CLI 安装和 /models 免费入口,强调早期 benchmark 表现。

传播作用:将 X 上的围观直接转为 coding agent 中的体验。

边界:评论质疑 benchmark 子集过小;传播帖不等于评测方法已获共识。

阶段 3 · 猜测与纠偏

R04|I fingerprinted Ox Alpha: same tokenizer as GLM-5.3 (+75 token offset)…

u/FlunkyGraphics · r/singularity · 2026-08-21 12:43 UTC · 225 分 / 57 评论

打开原帖

内容:6 组跨语言/代码/emoji 测试,固定 +75 token 偏移、同报错字符串、相近 temp-0 输出。

传播作用:将身份猜测变为可检查的黑盒指纹;评论也指出可能是别家基于 GLM 后训练。

边界:支持 GLM 血缘,不足以在当时独立证明开发主体与精确版本。

X05|建立猜身份与测试结果汇总串

AndrewCurran_ · 2026-08-21 13:35 UTC · 187,700 浏览 / 136 回复

打开原帖

内容:称前夜 GLM 是主要候选,但当天早上大家更不确定;聚合 demo、评测和工具接入。

传播作用:把碎片内容组织成持续更新的讨论中心;后来被 TechCrunch 引用。

边界:这是猜测的集散地,不是身份确认。

I’m making a thread for guesses and test results.

R05|Is Ox Alpha Z.ai’s unreleased GLM-5.3 Flash/Vision model? I ran 14 tokenizer probes…

u/yunes87 · r/opencode · 2026-08-21 16:33 UTC · 热度未核验(关键证据节点)

打开原帖

内容:评论补充 14 组探针、API 参数/错误、视觉测试的 reproduction kit;GLM-5.2 与 5.3 均匹配 14/14。

传播作用:展示社区追问可复现证据的过程。

边界:为关键技术节点,热度未核验;tokenizer 单独无法区分 5.2/5.3,更无法证明最终版本。

X10|单词 Gemini 被解读为暗示

EvanOtero · 2026-08-22 03:03 UTC · 112,600 浏览 / 156 回复

打开原帖

内容:发布单词“Gemini”;与随后提及 Ox 的玩笑一起被 Reddit 原帖引用。

传播作用:与账号的 Google AI Studio 关联叠加,制造候选身份的权威感。

边界:帖子没有明确说 Ox Alpha 由 Google 开发;不能写成 Google 认领。

Gemini

X11|“friends we made along the way”引爆猜测

EvanOtero · 2026-08-22 03:05 UTC · 1,400,000 浏览 / 255 回复

打开原帖

内容:用流行梗提及 Ox Alpha。

传播作用:140 万浏览;Reddit 的 Gemini 猜测帖明确链接它,跨平台传播路径可追踪。

边界:是模糊玩笑,不构成身份声明;认领后引发误导争议。

What if the Ox Alpha was the friends we made along the way

R06|Deepmind Researcher Strongly Hints Ox Alpha Is The Next Gemini Pro Model

u/Neurogence · r/singularity · 2026-08-22 05:00 UTC · 283 分 / 72 评论

打开原帖

内容:将 Evan 的两条 X 内容解读为 Gemini;评论以世界知识、tokenizer、输出特征反驳。

传播作用:可核实的 X 模糊表达 → Reddit 确定语气标题;身份悬念继续扩张。

边界:事后证明 Gemini 归属说不成立;原帖标题中的职位称呼未作独立核验。

R07|Ox Alpha can't be the Chinese.

u/IndependentFresh628 · r/singularity · 2026-08-22 10:19 UTC · 394 分 / 174 评论

打开原帖

内容:评论围绕模型对敏感政治问题的反应、语言与过滤机制争论。

传播作用:成为 TechCrunch 引用的两极化讨论样本,话题超出单纯编程能力。

边界:截图和拒答风格不是可靠国别鉴定;评论观点不代表研究结论。

X12|将 80% 更正为约 63%

davis7 · 2026-08-22 22:05 UTC · 415,900 浏览 / 47 回复

打开原帖

内容:明确说结果不是最初小子集的 80%;肯定长任务表现,同时指出死代码和速度问题。

传播作用:纠偏与追捧并行,讨论从“碾压”转向“不错、但慢”。

边界:其跟帖澄清测试由 Wenqi/DeepSWE 创作者做,仍是更大子集,并非完整测试。

Ended at ~63% NOT the 80% my first subset test got

阶段 4 · 规模放大

R08|What does everyone think of Ox Alpha?

u/jacobpowaza · r/opencode · 2026-08-23 22:42 UTC · 19 分 / 84 评论

打开原帖

内容:主帖认可能力却指出慢和错误;评论从编排、代码审查到实现任务给出明显不同评价。

传播作用:19 分但 84 评论,体现使用者深讨论;不能仅按净分判断价值。

边界:不是随机样本;不能统计总体满意率。

great when it works(评论)

X13|四天 26T token:用量成为新闻

opencode · 2026-08-24 17:51 UTC · 149,800 浏览 / 141 回复

打开原帖

内容:用一条极短数字帖展示四天 26T token。

传播作用:把“好不好”转换为“有多少人在用”的社会证明。

边界:token 不是人数或任务成功数;评论仍在追问随机停止。

26T tokens of Ox Alpha in 4 days

X14|8T/日与社区声音再包装

OpenRouter · 2026-08-24 21:41 UTC · 39,800 浏览 / 29 回复

打开原帖

内容:宣布达到 8T/日,并转引 Jacky 对 3000+ Discord 消息的总结;引文提到累计 16.6T。

传播作用:平台把社区讨论和消费量再加工为新的宣传素材,形成第二轮分发。

边界:本研究没有独立采集那 3000 条 Discord 消息;累计与单日指标必须分开。

X15|以 11.6T / 3 天讲述 agent 使用规模

rohanpaul_ai · 2026-08-25 00:44 UTC · 15,100 浏览 / 12 回复

打开原帖

内容:将高 token 消耗解释为长上下文、重试、工具调用驱动。

传播作用:KOL 给数字配上行业叙事,令用量成为 agent 趋势的证据。

边界:引用的时间窗口较早,不能与 8T/日直接比较;重试也会推高消耗。

X16|反面实测:105 个植入 bug 仅发现 16 个

PawelHuryn · 2026-08-25 12:21 UTC · 7,854 浏览 / 17 回复

打开原帖

内容:作者在两个仓库的 bug hunt 测试中感到失望,对比 Grok 4.6 的 27/105。

传播作用:为持续升温的叙事提供明确反证;说明任务不同,评价可能逆转。

边界:作者自行设计的测试,不宜外推所有编程场景;本研究未重跑。

阶段 5 · 认领与承接

R09|First serious confirmation. Ox Alpha is GLM-5.3-Flash

u/MrWidmoreHK · r/LocalLLaMA · 2026-08-26 06:28 UTC · 476 分 / 159 评论

打开原帖

内容:引用 Roman Chernin 的 X 帖,随后编辑说对方删除,截图留在评论;讨论时区、提前发布、权重和尺寸。

传播作用:揭晓当天先出现泄露式确认,后才出现官方主帖。

边界:被删 X 原帖抓取为 404;“协调投放/提前泄露”是社区解读,不能据此证明付费安排。

X17|六天 42T,并预告几小时后揭晓

opencode · 2026-08-26 09:56 UTC · 282,000 浏览 / 175 回复

打开原帖

内容:发布累计用量与“Reveal in a few hours”。

传播作用:把匿名期用量积累转为倒计时,集中最后一轮注意力。

边界:OpenCode 平台口径;不可与 OpenRouter 数值简单相加。

42T tokens of Ox Alpha in 6 days

R10|Ox Alpha is GLM 5.3 Flash by zAI

u/policyweb · r/singularity · 2026-08-26 11:14 UTC · 500 分 / 114 评论

打开原帖

内容:转引 Bloomberg 对智谱确认的报道,社区转向认领、开放权重及此前 Google 暗示争议。

传播作用:显示“媒体获得确认 → 社区转播”发生于 Z.ai X 正式发布之前。

边界:Bloomberg 正文抓取受限;其确认内容由 Reddit 摘引和随后官方 X 交叉支持。

X18|正式认领:GLM-5.3-Flash

Zai_org · 2026-08-26 14:12 UTC · 6,900,000 浏览 / 1,000 回复

打开原帖

内容:明确 Previously previewed as Ox Alpha;宣布 320B-A18B、1M、多模态、MIT 与中国 AI 芯片运行。

传播作用:把此前匿名口碑集中归因给智谱;本样本中认领阶段浏览量最高。

边界:性能、硬件与许可为官方披露;浏览量不等于独立触达或购买转化。

Previously previewed as Ox Alpha

X19|分发平台同步揭晓:六天逾 20T

OpenRouter · 2026-08-26 14:14 UTC · 295,600 浏览 / 102 回复

打开原帖

内容:确认 Ox 就是 GLM-5.3-Flash,称其为平台历史最大模型,并链接正式模型入口。

传播作用:闭合匿名入口 → 正式品牌的路径,承接已有开发者。

边界:“最大”及逾 20T 为平台自述。优惠价格与标准价有不同适用时段。

X20|转入 OpenCode Go 限时双倍用量

opencode · 2026-08-26 14:34 UTC · 657,100 浏览 / 232 回复

打开原帖

内容:用 formerly Ox Alpha 延续别名,公布 Go 接入和双倍用量。

传播作用:完成试用流量向正式渠道迁移;也引发“从无限到限量”的落差。

边界:评论对价格和额度不满,不等于已证实用户流失。

X21|独立评测叙事转向性价比

ArtificialAnlys · 2026-08-26 17:20 UTC · 167,000 浏览 / 62 回复

打开原帖

内容:公布 Intelligence Index 57、Cost per Task $0.09、320B/18B 等结果。

传播作用:认领后的传播从“是谁”转向“效率与成本”。

边界:该串后来纠正上下文由 400k 为 1M;缓存价格正文也不一致,标准价以官方为准。

X22|Cline:不到一周占流量逾 11%

cline · 2026-08-26 17:31 UTC · 139,800 浏览 / 63 回复

打开原帖

内容:称其为 Cline 历史增长最快模型,继续提供免费入口。

传播作用:揭晓不是传播终点,生态伙伴继续用真实接入与平台用量延长热度。

边界:11% 是平台宣称的流量占比,不能解读为全市场份额。

R11|The way Google / Ai Studio employees insinuating as if Ox Alpha was Google’s model…

u/Snoo_64233 · r/Bard · 2026-08-26 20:28 UTC · 237 分 / 46 评论

打开原帖

内容:指责模糊发帖令人误解;评论分成“蹭热度”与“读者过度解读”两派。

传播作用:揭晓后的二次传播变成声誉与沟通争议,而非只有智谱技术讨论。

边界:不将网友对动机的判断写作事实;保留反对意见。

十、方法、来源与限制

研究窗口:2026-08-20 至 2026-08-27(核心事件集中 20–26 日);采集日:2026-09-22。时间统一为 UTC,北京时间加 8 小时;例如 8 月 20 日 20:59 UTC 对应北京时间 8 月 21 日 04:59。X 日期按帖子 ID 时间戳与页面日期交叉核对,Reddit 读取页面 time 字段。浏览量、分数和评论数均为采集时点快照,含事件后增长,不是当天峰值。

本报告为公开检索与定向原帖核验,不是全量社交监测。精选 33 条主帖(X 22、Reddit 11),另引用媒体及评论链。“热门”指已核实样本内较高浏览/分数/评论,或具关键转播作用的节点,不声称平台全站 Top。X 用浏览量、Reddit 用净分与评论数分别观察;不混算热度、不汇总为去重触达。R05 热度未核验,保留为空。

检索别名:Ox Alpha、ox-alpha、ox_alpha、stealth/ox-alpha、牛来、GLM-5.3-Flash。覆盖 r/singularity、r/opencode、r/opencodeCLI、r/LocalLLaMA、r/accelerate、r/Bard;X 覆盖发布平台、模型官方、评测者、生态伙伴及关键猜测传播者。先通过搜索发现,再抓取 X 正文并以浏览器核验 Reddit 主帖、评论和日期。主帖以唯一 URL 去重,同线程引用不视为额外独立触达。

证据等级:官方原帖可证明“官方发布/声称了什么”;用户实测可证明其公开报告的结果,不等于独立重跑;媒体引用用于验证扩散关系;研究推论明确标注。全部热度均为公开快照,缺少逐小时记录、曝光受众重叠、付费推广数据与代表性抽样,因此不输出伪精确的情绪比例、日声量曲线或传播归因百分比。

访问限制:Reddit 直抓返回 403,已用登录浏览器读取公开原帖;Bloomberg 正文 403,仅采用 Reddit 中明确的报道摘引并与官方认领交叉核实;Roman 提前发布的 X 原帖 404,只记录 Reddit 当时引用与“删除”的编辑说明。技术测试不重跑,图片与视频的性能宣称按作者陈述处理。

辅助媒体:M01|TechCrunch,2026-08-23M02|Bloomberg,2026-08-26(正文访问受限)。产品资料入口:Z.ai 官方博客权重页面;本报告具体认领事实以 X18 官方原帖为证。

——研究档案完——

交付与使用

看板无外部脚本或字体依赖,保存 HTML 可离线查看分析与帖子库;原帖、Notion 和同目录附件需联网或保留对应文件。北京时间 = UTC + 8 小时。