NVDA, AMD, GOOGL, META, MSFT · 美股
开源模型是否在追赶?三个时代的追赶速度|SemiAnalysis 笔记
SemiAnalysis 划分 scaling / reasoning / agentic 三时代;开源权重每时代以约一半时间逼近闭源前沿(Kimi K2.6 vs Opus 4.5 ~4.8 月),但 benchmark 与产品仍脱节。对照 AgentX v3、CUDA 护城河、NVDA。
章节深链示例:/zh/r/sa-open-models-catching-up-2026#thesis
数据时点:2026-09-25(周度刷新;个股按 §A 标准档对齐,缺数用 N/A/null,非投资建议)
开源模型是否在追赶?三个时代的追赶速度
来源:SemiAnalysis — Are Open Models Catching Up?(2026-08-21)。本页为 Investor Research 摘要笔记,非原文转载。
核心判断
SemiAnalysis 将大模型演进划分为 scaling → reasoning → agentic 三个时代,并观察到:开源权重在每个时代以约一半时间逼近闭源前沿——但 benchmark 分数与日常产品体验仍明显脱节;作者团队仍偏好 Anthropic Claude 作为日常工作模型。
与 agentic 推理栈实测直接相关的是同期发布的 AgentX InferenceX v3:当 workload 从单轮 chat 转向长上下文、多轮、子 agent 时,硬件 perf/$ 与软件 composability 的分化比 leaderboard 更能解释投资逻辑(见 CUDA 护城河、TileRT InferenceX)。
三时代与追赶曲线
Era 1 — Scaling(预训练规模)
- Llama 3.1 405B 相对 GPT-4o 的 gap 约 6 个月量级(SA 口径)。
- 含义:开源在 dense scaling 阶段已能较快复刻闭源能力曲线,但数据、算力与 post-training 资源仍向头部闭源实验室集中。
Era 2 — Reasoning(推理/RL)
- DeepSeek R1 相对 OpenAI o1 约 6 个月。
- 推理时代竞争焦点从参数规模转向 RL 数据、verifier 与 inference-time compute;与 CPU 行业 中「推理侧 CPU 编排」叙事、以及 ISA 格局 中边缘/本地推理讨论形成对照。
Era 3 — Agentic(工具、多轮、子 agent)
- Kimi K2.6 vs Claude Opus 4.5:约 4.8 个月。
- GLM-5.2 vs GPT-5.2:约 6 个月。
- Agentic 时代 gap 进一步缩短,但 trace 分布、KV cache 复用、routing 等生产特征在 AgentX v3 中才被系统量化(P90 ISL 317k、95%+ KV hit rate 等)。
SA 对产品 vs benchmark 的保留
- 团队仍认为 Claude 在日常 coding/agent 任务上更可靠;开源模型可能在 SWE-bench / 公开 leaderboard 上接近,却在 工具调用稳定性、长会话一致性 上落后。
- RL hill-climbing:开源社区可能针对公开 benchmark 过度优化,导致「评测强、产品弱」——与 Meta 超级智能路线、Gemini/GCP 等闭源实验室的 私有 eval + 产品闭环 形成对比。
对算力与软件栈的含义
训练 vs 推理
- Scaling 时代利好 训练 GPU 资本开支(NVDA、AMD、AVGO 定制 ASIC 叙事见 Google–AMD TPU 传闻)。
- Agentic 时代增量更多落在 推理 perf/$、KV 内存、disaggregation——见 GPU 利用率、Vera/Rubin NVL72 TCO、Cerebras CS-4 等非 GPU 路径对照。
云与分发
- 闭源 API(GOOGL Gemini、MSFT Copilot、AMZN Bedrock)仍掌握 分发与计费;开源权重压缩 模型层 margin,抬升 infra 与 neo-cloud 价值(CRWV、NBIS、IREN)。
中国开源 vs 西方闭源
- Kimi、GLM、DeepSeek、Qwen 等加速追赶,与 AgentX 中 MI355X / Kimi K3 / MiniMax M3 实测矩阵一致;出口管制与权重合规 仍是西方云厂商采用开源权重的 friction。
展望
- Gap 继续缩短 在 agentic era 仍可能成立,但 半衰期 是否维持「每时代一半」取决于闭源实验室是否扩大 私有数据与 product RL 优势。
- 投资上应同时跟踪:(1) 开源 leaderboard、(2) AgentX 类生产 workload 基准、(3) 推理软件栈 PR velocity(CUDA 护城河、TileRT)。
- INTC 等 CPU 玩家在 edge agent、本地小模型 的角色可能随开源小模型质量上升而增强,但 datacenter agentic 主战场仍在 GPU + 全栈软件。
风险
- Benchmark 与产品脱节;RL 过拟合公开评测。
- 闭源实验室仍控制 顶级 post-training 算力与用户反馈闭环。
- 地缘政治、版权与 权重出口 限制跨境部署。
- 开源加速 commoditize 模型层,压缩纯 API 毛利(利好 infra、利空无差异化的模型 API 纯 play)。
参考
- SemiAnalysis — Are Open Models Catching Up?(2026-08-21)
- 关联笔记:AgentX InferenceX v3 · CUDA 护城河 · TileRT InferenceX · Gemini/GCP · Meta 超级智能
- 关联研报:NVDA · AMD · GOOGL · MSFT · GPU 利用率 · CPU 行业
评论
登录后评论