<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Learning | Zunzhe Zhang</title><link>https://tuagoale.github.io/learning/</link><atom:link href="https://tuagoale.github.io/learning/index.xml" rel="self" type="application/rss+xml"/><description>Learning</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Wed, 24 Jun 2026 00:00:00 +0000</lastBuildDate><image><url>https://tuagoale.github.io/media/icon.svg</url><title>Learning</title><link>https://tuagoale.github.io/learning/</link></image><item><title>认真看待缩放定律</title><link>https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/</link><pubDate>Wed, 24 Jun 2026 00:00:00 +0000</pubDate><guid>https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/</guid><description>
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;原文：Lilian Weng,
, Lil&amp;rsquo;Log, June 24, 2026。本文为中文译文，保留原文主要公式、图示与引用。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;缩放定律是深度学习中最关键的经验发现之一。它的观察形式很简单：随着模型规模 \(N\)、数据集规模 \(D\) 和计算量 \(C\) 增大，训练损失 \(L\) 会按照幂律曲线可预测地下降；在 log-log 图上，这条曲线会表现为一条直线。我们可以把缩放定律看作描述计算量、损失、模型规模和数据之间关系的一套框架；其核心问题是，如何在 \(N\) 和 \(D\) 之间最优地分配宝贵的计算资源。&lt;/p&gt;
&lt;p&gt;这种可预测性让缩放定律在实践中非常有价值。常见做法是先用少量小规模训练实验拟合缩放定律，然后外推估计更大模型所需的 token 数和计算量。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;符号&lt;/th&gt;
&lt;th&gt;含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;\(N\)&lt;/td&gt;
&lt;td&gt;模型规模，通常以参数量衡量。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;\(D\)&lt;/td&gt;
&lt;td&gt;训练数据集规模，通常以 token 数衡量。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;\(C\)&lt;/td&gt;
&lt;td&gt;训练计算量，单位为 FLOPs。一个有用近似是 \(C \approx 6ND\)（
），其中 \(2ND\) 对应前向传播，\(4ND\) 对应反向传播。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;\(E\)&lt;/td&gt;
&lt;td&gt;不可约损失。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;\(L, \hat{L}(.)\)&lt;/td&gt;
&lt;td&gt;测试损失或测试损失预测函数；因为训练损失和测试损失强相关，也可指训练损失。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;\(\epsilon\)&lt;/td&gt;
&lt;td&gt;泛化误差。&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h1 id="早期工作机器学习损失的可预测性"&gt;早期工作：机器学习损失的可预测性&lt;/h1&gt;
&lt;p&gt;在缩放定律成为主流概念之前，研究者已经开始探索泛化误差随规模变化的可预测性。&lt;/p&gt;
&lt;p&gt;
用贝叶斯方法和退火近似推导了四类学习曲线：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;确定性学习算法、无噪声数据、唯一解：\(\epsilon \sim c \cdot D^{-1}\)，其中 \(c\) 是某个常数。&lt;/li&gt;
&lt;li&gt;确定性学习算法、无噪声数据、多个等价解：\(\epsilon \sim c \cdot D^{-2}\)。每增加一个数据点，学习会更快，因为模型只需要学习最优参数流形，而不是寻找单个解点。&lt;/li&gt;
&lt;li&gt;确定性学习算法、有噪声数据：\(\epsilon \sim c \cdot D^{-1/2}\)。数据噪声会让学习更困难。&lt;/li&gt;
&lt;li&gt;随机学习算法、有噪声数据：\(\epsilon \sim c \cdot D^{-1} + E\)。这里不可约损失 \(E\) 是随机学习器无法继续降低的残余误差，例如模型在大数据上耗尽容量时的误差。四类学习曲线都遵循幂律：&lt;/li&gt;
&lt;/ol&gt;
\[
\epsilon \sim c \cdot D^\alpha + E
\]&lt;p&gt;其中 \(E\) 可以为 0，\(\alpha = -2, -1, -1/2\)。尽管他们的理论设定基于一个简化的二分类任务，但它为构建经验性的机器学习损失预测模型指明了一个有用方向。&lt;/p&gt;
&lt;p&gt;早期经验研究中，
解释了泛化误差、模型规模和数据之间的关系。对于给定训练数据量，他们通过网格搜索找出最佳拟合模型规模，然后绘制损失相对于训练数据量的变化。在深度学习的四个不同领域中，神经机器翻译、图像分类、语言建模和语音识别都反复出现了如下模式：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;泛化误差会随某些因素，例如数据规模，呈幂律缩放。&lt;/li&gt;
&lt;li&gt;模型改进会平移误差曲线，但似乎不会改变幂律指数。&lt;/li&gt;
&lt;li&gt;有趣的是，架构会改变幂律拟合的偏移项 \(E\)，但不会改变指数 \(\alpha\)。幂律斜率看起来更像是问题领域的属性，而不是模型架构的属性。&lt;/li&gt;
&lt;li&gt;拟合规模为 \(D\) 的数据集所需的模型参数量 \(N\) 也遵循幂律。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Deep-Speech-2 与 attention speech model 的学习曲线，以及不同规模 DS2 模型的学习曲线。小模型在训练数据变大时会进入损失平台期。"
srcset="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/hestness-1_hu_8a5e6a970139bf76.webp 320w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/hestness-1_hu_468a402afb696a23.webp 480w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/hestness-1_hu_dc411a6dde54dd0b.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/hestness-1_hu_8a5e6a970139bf76.webp"
width="760"
height="302"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：左侧是 Deep-Speech-2 与 attention speech model 的学习曲线，右侧是不同规模 DS2 模型的学习曲线。小模型在训练数据变大时会进入损失平台期。图片来源：Hestness et al. 2017。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;一个概念图可以把学习曲线分成三个阶段。在小数据区域，学习信号不足，模型只比随机猜测略好。中间的“幂律区域”中，我们会观察到损失、数据和模型规模之间的幂律关系。最后的不可约误差区域可以归因于数据噪声等因素。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="幂律学习曲线阶段示意图。"
srcset="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/hestness-2_hu_74acec42fe79b6dd.webp 320w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/hestness-2_hu_fe5a7a97f8f007b0.webp 480w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/hestness-2_hu_8d945a8fd5d91b45.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/hestness-2_hu_74acec42fe79b6dd.webp"
width="760"
height="529"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：幂律学习曲线阶段示意图。图片来源：Hestness et al. 2017。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;
进一步尝试把误差建模为模型规模 \(N\) 和数据规模 \(D\) 的联合函数，覆盖多种架构（ResNet、WRN、LSTM、Transformer）和优化器（Adam、SGD 变体）。经验上，他们观察到，当固定其中一个轴时，误差会随另一个轴按照幂律下降：&lt;/p&gt;
\[
\hat{L}(D,N) \approx \frac{A}{N^{\alpha}} + E_N,\quad
\hat{L}(D,N) \approx \frac{B}{D^{\beta}} + E_D
\]&lt;p&gt;它们可以组合成一个联合形式：&lt;/p&gt;
\[
\hat{L}(D, N) \approx \frac{A}{N^{\alpha}} + \frac{B}{D^{\beta}} + E
\]&lt;p&gt;其中 \(A &gt; 0, B &gt; 0, \alpha \geq 0, \beta \geq 0\) 是标量常数，\(E\) 不依赖于 \(N\) 或 \(D\)。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="数据规模、模型规模和泛化误差在 log-log-log 尺度上的 3D 等高线图。"
srcset="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/rosenfeld-1_hu_d7bd76477f8cbd21.webp 320w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/rosenfeld-1_hu_3ab75797d37ada05.webp 480w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/rosenfeld-1_hu_7817a1c811a163a8.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/rosenfeld-1_hu_d7bd76477f8cbd21.webp"
width="760"
height="353"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：数据规模、模型规模和泛化误差在 log-log-log 尺度上的 3D 等高线图。蓝点来自经验实验，曲面是蓝点之间的线性插值。图片来源：Rosenfeld et al. 2020。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;因此，他们可以用一个简单的参数函数 \(\boldsymbol{\theta} = \langle A, B, E, \alpha, \beta \rangle\) 建立预测模型，只通过训练一组较小配置 \((D, N)\) 的实验，就能预测超过某些阈值时 \((D, N)\) 对应的期望损失。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="在小规模配置上拟合参数化误差模型，并外推到更大的模型和数据规模。"
srcset="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/rosenfeld-2_hu_aace89ddc6ffb13.webp 320w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/rosenfeld-2_hu_4759962b75841887.webp 480w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/rosenfeld-2_hu_a637ef442930b2d6.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/rosenfeld-2_hu_aace89ddc6ffb13.webp"
width="760"
height="266"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：在小规模配置上拟合参数化误差模型，并外推到更大的模型和数据规模：（a）实验设置示意；（b）ImageNet、（c）WikiText-103 和（d）CIFAR100 上的误差估计，包含三种架构（WRN、VGG、DenseNet）和两种优化器（SGD、Adam）。图片来源：Rosenfeld et al. 2020。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;旁注：这些早期工作依赖一些经典学习理论直觉，例如把
（模型能够打散的最大点集大小）作为容量代理。但在现代深度学习中，VC 维往往太粗糙，难以解释真实行为；经验幂律最终比最坏情况理论界更清晰，也更实用。&lt;/p&gt;
&lt;h1 id="数据无限区域中的缩放定律"&gt;数据无限区域中的缩放定律&lt;/h1&gt;
&lt;h2 id="kaplan-et-al-的缩放定律"&gt;Kaplan et al. 的缩放定律&lt;/h2&gt;
&lt;p&gt;
在语言建模社区推广了缩放定律这个概念。他们发现，在多个数量级范围内，交叉熵测试损失 \(L\) 会分别随模型规模 \(N\)（不含 embedding 层）、数据集规模 \(D\) 和训练计算量 \(C\) 呈幂律缩放。这些发现与上一节早期工作一致，但 Kaplan et al. 用 Transformer 语言模型和更大规模的经验实验把这个概念形式化了。他们的模型规模范围从 768M 到 1.5B 非 embedding 参数，数据集规模从 22M 到 23B token。论文中的所有训练都使用 3000 step 线性 warmup，然后余弦衰减到 0 的学习率计划。&lt;/p&gt;
&lt;p&gt;关键发现包括：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;损失 \(L\) 会分别随 \(N\)、\(D\)、\(C\) 呈幂律缩放；为了达到最优性能，三者都必须一起扩展。&lt;/li&gt;
&lt;li&gt;训练曲线遵循可预测的幂律，并且其参数大体独立于模型规模。&lt;/li&gt;
&lt;li&gt;更大的模型样本效率更高，也就是说，它们可以用更少优化步数和更少数据点达到给定损失。&lt;/li&gt;
&lt;li&gt;架构细节，例如宽度、宽高比等，相比纯粹规模没有那么重要。&lt;/li&gt;
&lt;li&gt;训练损失和测试损失正相关。（听起来显然，但这是预训练工作的基础。另一方面，预训练损失的改善能否迁移到 post-training 评测，需要单独研究。）&lt;/li&gt;
&lt;li&gt;在固定计算预算下，训练一个非常大的模型并在收敛前停止，比把一个较小模型完整训练到收敛更高效。&lt;strong&gt;这一点正是 Chinchilla 缩放定律在下一节中反对的地方：Kaplan et al. 因为拟合出的指数更大，高估了最优模型规模。&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;他们用一个方程总结 \(N\) 和 \(D\) 的联合依赖关系：&lt;/p&gt;
\[
\hat{L}(N,D) = \left[ \left(\frac{a}{N}\right)^{\frac{\alpha}{\beta}} + \frac{b}{D} \right]^{\beta}
\]&lt;p&gt;这个形式有一个不错的推论：过拟合程度，也就是模型复杂或数据过少，主要取决于比值 \(N^{\alpha / \beta} / D\)。这说明为了避免训练进入数据受限状态，数据需要按照某种特定比例随模型规模增长。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="测试损失随计算量、数据集规模和参数量呈幂律变化，覆盖多个数量级。"
srcset="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/kaplan-1_hu_630312df0b271a11.webp 320w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/kaplan-1_hu_5ed7cadc264f938.webp 480w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/kaplan-1_hu_d1fd87fdd58403ab.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/kaplan-1_hu_630312df0b271a11.webp"
width="760"
height="241"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：测试损失随计算量、数据集规模和参数量呈幂律变化，覆盖多个数量级。图片来源：Kaplan et al. 2020。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;最有影响力、事后看也最有争议的结论，是关于 compute-optimal 分配。Kaplan et al. 发现 \(N_\text{opt} \propto C^{0.73}\)，并认为模型规模应该比数据集规模增长得更快。具体来说，计算量增加 10 倍时，他们建议模型规模扩大约 5.5 倍，而训练 token 只扩大约 1.8 倍。之后 Chinchilla 论文推翻了这个建议，认为这样会让大模型严重训练不足。&lt;/p&gt;
&lt;p&gt;Kaplan et al. 中另一个有用分析，是基于 \(D\) 和 \(N\) 估算所需训练 FLOPs。每个 multiply-add 被计为约 2 FLOPs。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="给定 Transformer 架构组件时的参数与计算量估算。"
srcset="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/kaplan-2_hu_7a1fdf67e4d965aa.webp 320w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/kaplan-2_hu_c6a491975ab296b6.webp 480w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/kaplan-2_hu_f58c8324d4e7641b.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/kaplan-2_hu_7a1fdf67e4d965aa.webp"
width="760"
height="277"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：给定层数 \(n_\text{layer}\)、模型宽度 \(d_\text{model}\)（即 \(d_\text{embed}\)，原表中符号不完全一致）、前馈层维度 \(d_\text{ff}\)（通常等于 \(4d_\text{model}\)）、attention 维度 \(d_\text{attn}\)（通常等于 \(d_\text{model}\)）、上下文长度 \(n_\text{ctx}\) 和词表大小 \(n_\text{vocab}\) 时，不同 Transformer 组件的参数与计算量估算。图片来源：Kaplan et al. 2020。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;在标准配置 \(d_\text{attn} = d_\text{model} = d_\text{ff}/4\) 下，并且从 \(N\) 和每 token 前向计算中排除 embedding 层：&lt;/p&gt;
\[
\begin{align}
N &amp;= n_\text{layer} d_\text{model} 3 d_\text{attn} + n_\text{layer} d_\text{attn} d_\text{model} + n_\text{layer} 2 d_\text{model} d_\text{ff} &amp; \small{\text{; no embedding layer}} \\
&amp;= 2\;n_\text{layer} d_\text{model}(2d_\text{attn} + d_\text{ff}) &amp; \\
&amp;= 12\;n_\text{layer} d_\text{model}^2 &amp; \\
\\
C_\text{fwd} &amp;= 2 n_\text{layer} (d_\text{model} 3 d_\text{attn} + n_\text{ctx}d_\text{attn} + d_\text{attn}d_\text{embed} + 2 d_\text{model} d_\text{ff}) &amp; \\
&amp;= 2 n_\text{layer} (12 d_\text{model}^2 + n_\text{ctx}d_\text{attn}) &amp; \\
&amp;= 2N + 2 n_\text{layer}n_\text{ctx}d_\text{attn} &amp; \\
&amp;\approx 2N \quad\quad \small{\text{; assuming }n_\text{ctx} &lt; 12 d_\text{model} \text{ and the }n_\text{ctx}\text{ term is relatively small.}}\\
\end{align}
\]&lt;p&gt;然后，我们把反向传播 FLOPs 计为前向传播 FLOPs 的两倍，因为反向传播会运行两次矩阵乘法，分别计算输入激活和权重的梯度。因此，总训练 FLOPs 每 token 约为 \(6N\)，在 \(D\) 个 token 上训练的总 FLOPs 约为 \(C \approx 6ND\)。&lt;/p&gt;
&lt;h2 id="chinchilla-缩放定律"&gt;Chinchilla 缩放定律&lt;/h2&gt;
&lt;p&gt;Chinchilla 论文（
）用更仔细的实验设计，研究固定计算预算 \(C\) 下最优模型规模 \(N\)（总参数量，包含 embedding）和 token 数 \(D\) 的关系，并得出了一个与 Kaplan et al. 有些不同的答案。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="你应该知道 Chinchilla 长什么样。"
srcset="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/animal_hu_659b781b0e05a13a.webp 320w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/animal_hu_81470b6112b0039e.webp 480w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/animal_hu_c927dcdaad051eff.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/animal_hu_659b781b0e05a13a.webp"
width="760"
height="237"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：你应该知道 Chinchilla 长什么样。图片来源：ChatGPT 生成。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;核心问题是：在约束 \(\text{FLOPs}(N, D) = C \approx 6ND\) 下，应该如何分配资源？换句话说，当 FLOPs 有限，也就是只有给定数量 GPU 和给定训练时间时，我们该如何在更多数据 token 和更多模型参数之间做选择？&lt;/p&gt;
\[
N_\text{opt}(C), D_\text{opt}(C) = \operatorname*{arg\,min}_{\text{s.t. } \text{FLOPs}(N,D) = C} \hat{L}(N, D)
\]&lt;p&gt;Chinchilla 论文提出了三种设计整洁的缩放定律拟合方法。&lt;/p&gt;
&lt;p&gt;他们的经验实验扫描了超过 400 个模型，规模从 70M 到超过 16B 参数，训练 token 从 5B 到 500B。实验假设每个训练 token 都是唯一的，即数据无限区域。所有训练都使用余弦学习率计划，在训练过程中衰减 10 倍。扫过模型规模会描出 compute-optimal 前沿。&lt;/p&gt;
&lt;h3 id="方法-1固定模型规模改变-token-预算"&gt;方法 1：固定模型规模，改变 token 预算&lt;/h3&gt;
&lt;p&gt;对于每个参数量 \(N\)，用不同 token 预算训练多个 run，并记录每个 FLOP 预算 \(C\) 下达到的最小损失。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Chinchilla 方法 1：对一组模型规模扫描 FLOP 预算上的训练损失曲线。"
srcset="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/chinchilla-1_hu_84f5e4973d0aa8b7.webp 320w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/chinchilla-1_hu_bd813c3818756f88.webp 480w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/chinchilla-1_hu_72ba59561ac7d266.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/chinchilla-1_hu_84f5e4973d0aa8b7.webp"
width="760"
height="218"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：Chinchilla 方法 1：对一组模型规模扫描 FLOP 预算上的训练损失曲线。图片来源：Hoffmann et al. 2022。&lt;/em&gt;&lt;/p&gt;
&lt;h3 id="方法-2isoflop-profiles"&gt;方法 2：IsoFLOP profiles&lt;/h3&gt;
&lt;p&gt;固定计算预算 \(C\)，绘制最终损失相对于参数量 \(N\) 的曲线。每条 iso-FLOP 曲线在 log 空间中大致像一个抛物线，它的最低点标记该计算预算下的最优模型规模。重复多个预算后，就能在图上描出一条幂律线。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Chinchilla 方法 2：IsoFLOP 抛物线，每条曲线的最低点就是该预算下的 compute-optimal 模型规模。"
srcset="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/chinchilla-2_hu_8adea23456492d09.webp 320w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/chinchilla-2_hu_5cfec1c72e8dc322.webp 480w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/chinchilla-2_hu_b410f9c706fda9b6.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/chinchilla-2_hu_8adea23456492d09.webp"
width="760"
height="228"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：Chinchilla 方法 2：IsoFLOP 抛物线，每条曲线的最低点就是该预算下的 compute-optimal 模型规模。图片来源：Hoffmann et al. 2022。&lt;/em&gt;&lt;/p&gt;
&lt;h3 id="方法-3参数化拟合"&gt;方法 3：参数化拟合&lt;/h3&gt;
&lt;p&gt;直接拟合与
相同的参数函数：&lt;/p&gt;
\[
\hat{L}(N, D) = \frac{A}{N^\alpha} + \frac{B}{D^\beta} + E
\]&lt;p&gt;在约束 \(\text{FLOPs}(N,D) = C \approx 6ND\) 下最小化 \(\hat{L}(N, D)\)，其实可以得到最优 \(N_\text{opt}(C), D_\text{opt}(C)\) 的闭式近似。&lt;/p&gt;
&lt;p&gt;首先把表达式化简成只包含 \(N\)：&lt;/p&gt;
\[
\begin{align}
\hat{L}(N) &amp;= A N^{-\alpha} + B \Big(\frac{C}{6}\Big)^{-\beta}N^\beta + E \\
\hat{L}'(N) &amp;= -\alpha A N^{-\alpha-1} + \beta B \Big(\frac{C}{6}\Big)^{-\beta} N^{\beta -1} = 0 &amp; \small{\text{; derivative wrt }N\text{ should be zero.}} \\
\text{Thus}\quad &amp; \alpha A N^{-\alpha-1} = \beta B \Big(\frac{C}{6}\Big)^{-\beta} N^{\beta -1} \\
&amp; \alpha A = \beta B \Big(\frac{C}{6}\Big)^{-\beta} N^{\alpha + \beta} \\
&amp; N_\text{opt} = \Big(\frac{\alpha A}{\beta B}\Big)^{\frac{1}{\alpha + \beta}} \Big(\frac{C}{6}\Big)^{\frac{\beta}{\alpha+\beta}} \\
&amp; D_\text{opt} = \frac{C}{6 N_\text{opt}} = \Big(\frac{\beta B}{\alpha A}\Big)^{\frac{1}{\alpha + \beta}} \Big(\frac{C}{6}\Big)^{\frac{\alpha}{\alpha+\beta}}
\end{align}
\]&lt;p&gt;当 \(\alpha \approx \beta\) 时，模型规模和训练 token 数应该以相同速度扩展。&lt;/p&gt;
&lt;p&gt;为了找到最优 \(\boldsymbol{\theta} = \langle A, B, E, \alpha, \beta\rangle\)，Chinchilla 论文采用
（对异常值鲁棒，\(\delta=10^{-3}\)）和
（适合参数量较少的曲线拟合）。&lt;/p&gt;
\[
\begin{align}
\min_{A,B,E,\alpha,\beta} \sum_{\text{runs }\{i\}} \text{Huber}_\delta (\log \hat{L}(N_i, D_i) - \log L_i) \\
\text{ where }\text{Huber}_\delta (x) = \begin{cases}\frac{1}{2} x^2 &amp; \text{for }\vert x \vert \leq \delta \\ \delta \cdot (\vert x \vert - \frac{1}{2}\delta), &amp; \text{otherwise.}\end{cases}
\end{align}
\]&lt;p&gt;Chinchilla 通过三种互补方法得到最终答案，而且三者结果彼此一致，这也是该结论很有说服力的一部分原因。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="三种方法都指向一个 compute-optimal 前沿，其中 \(N_\text{opt} \propto C^{0.5}\)，但它们与 Kaplan et al. 不一致。"
srcset="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/chinchilla-3_hu_948185fbd4762231.webp 320w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/chinchilla-3_hu_85ca7527702ecade.webp 480w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/chinchilla-3_hu_685066f773f10df7.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/chinchilla-3_hu_948185fbd4762231.webp"
width="760"
height="172"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：三种方法都指向一个 compute-optimal 前沿，其中 \(N_\text{opt} \propto C^{0.5}\)，但它们与 Kaplan et al. 不一致。注意，方法 3 的结果与另外两种方法稍有偏差，后文会解释。图片来源：Hoffmann et al. 2022。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Chinchilla 三种预测方法以及 Kaplan et al. (2020) 预测的对比图。"
srcset="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/chinchilla-4_hu_50263363d46dcfac.webp 320w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/chinchilla-4_hu_ddfa6f1077536eba.webp 480w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/chinchilla-4_hu_62487610efcfcf8e.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/chinchilla-4_hu_50263363d46dcfac.webp"
width="760"
height="410"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：Chinchilla 三种预测方法以及 Kaplan et al. (2020) 预测的对比图。三种方法都表明，当时几个主流 LLM 训练不足。图片来源：Hoffmann et al. 2022。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;Chinchilla 论文认为当时（约 2022 年）多数大模型训练不足，这一点有一个著名例证：在与 Gopher（
，280B 参数、300B token 预算）相同计算预算下，他们训练了 Chinchilla（70B 参数、1.4T token 预算）。这个模型参数量小了 4 倍，但训练 token 约多了 4 倍，并且在各项任务上全面超过 Gopher。&lt;/p&gt;
&lt;h2 id="调和-kaplan-和-chinchilla"&gt;调和 Kaplan 和 Chinchilla&lt;/h2&gt;
&lt;p&gt;Chinchilla 缩放定律与 Kaplan et al. 的分歧如下：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Kaplan 的结论是“模型增长要快于数据”（\(N_\text{opt} \propto C^{0.73}\)）；Chinchilla 的结论是，每当模型规模翻倍，训练 token 数也应该翻倍（\(N_\text{opt} \propto C^{0.5}\)）。&lt;/li&gt;
&lt;li&gt;Kaplan 的结论是“训练一个大模型并在收敛前停止”；Chinchilla 的结论是，应该训练一个更小模型，并用更多数据。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;两篇论文仍然同意同一个基本原则，但它们对最优模型规模与 token 之间权衡点的判断差异很大。为什么会差这么多？&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;差异 1：Kaplan et al. 主要在小模型上实验。&lt;/strong&gt; Kaplan et al. 的实验主要集中在较小模型，而 Chinchilla 论文的实验规模超过前者 10 倍以上。当我们在 log-log 空间外推时，拟合上的一点小差异就可能导致很大的结果差异，后面的玩具模拟也展示了这一点。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;差异 2：小模型中 embedding 参数量很重要。&lt;/strong&gt; 在小参数区域，embedding 参数是总参数量中不可忽略的一部分，因此是否计入 embedding 很重要。
沿着这个方向做了细致分析。我们用 \(N_{\setminus E}, C_{\setminus E}\) 表示排除 embedding 时的模型规模和计算量，用 \(N, C\) 表示总参数量和总计算量。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Kaplan et al.: \(N^*_{\setminus E} \propto C^{0.73}_{\setminus E}\)（不含 embedding）&lt;/li&gt;
&lt;li&gt;Chinchilla: \(N^* \propto C^{0.50}\)（总参数量）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;为了把两者联系起来，他们为总参数量 \(N_T\) 和非 embedding 参数量 \(N_{\setminus E}\) 拟合了如下关系，其中 \(\omega\) 是常数：&lt;/p&gt;
\[
N = N_{\setminus E} + \omega\, N_{\setminus E}^{1/3}.
\]&lt;p&gt;这个形式有一些不错的性质：它严格单调递增，而且 \(\lim_{N \to \infty} N = N_{\setminus E}\)，因为 \(\frac{N}{N_{\setminus E}} = 1 + \omega {N_{\setminus E}}^{- \frac{2}{3}}\)，所以 \(\lim_{N_{\setminus E} \to \infty} \frac{N}{N_{\setminus E}} = 1\)。&lt;/p&gt;
&lt;p&gt;把它代入 Chinchilla 定律方程：&lt;/p&gt;
\[
\begin{align}
L(N_{\setminus E}, C_{\setminus E}) &amp;= A(N_{\setminus E} + \omega\, N_{\setminus E}^{1/3})^{-\alpha} + B \Big(\frac{C_{\setminus E}}{6}\Big)^{-\beta} N_{\setminus E}^\beta + E \\
L'(N_{\setminus E}, C_{\setminus E}) &amp;= - \alpha A (N_{\setminus E} + \omega N_{\setminus E}^{1/3})^{-\alpha -1}(1 + \frac{\omega}{3}N_{\setminus E}^{-2/3}) + \beta B \Big(\frac{C_{\setminus E}}{6}\Big)^{-\beta} N_{\setminus E}^{\beta -1} = 0 &amp; \small{\text{; derivative wrt }N_{\setminus E}\text{ should be zero.}} \\
\text{Rearrange to get }&amp; \alpha A (N^{*}_{\setminus E} + \omega {N^{*}_{\setminus E}}^{1/3})^{-\alpha -1}(1 + \frac{\omega}{3} {N^{*}_{\setminus E}}^{-2/3}) = \beta B \Big(\frac{C_{\setminus E}}{6}\Big)^{-\beta} {N^{*}_{\setminus E}}^{\beta -1} \\
&amp; 6^{-\beta}\frac{\alpha A}{\beta B} ({N^{*}_{\setminus E}} + \omega {N^{*}_{\setminus E}}^{1/3})^{-\alpha -1}(1 + \frac{\omega}{3}{N^{*}_{\setminus E}}^{-2/3}) {N^{*}_{\setminus E}}^{1 - \beta} = C_{\setminus E}^{-\beta} \\
&amp; 6 \Big(\frac{\beta B}{\alpha A}\Big)^{\frac{1}{\beta}} ({N^{*}_{\setminus E}} + \omega {N^{*}_{\setminus E}}^{1/3})^{\frac{1 + \alpha}{\beta}} ({N^{*}_{\setminus E}} + \frac{\omega}{3}{N^{*}_{\setminus E}}^{1/3})^{-\frac{1}{\beta}} {N^{*}_{\setminus E}} = C_{\setminus E}
\end{align}
\]&lt;p&gt;上式中 \(C_{\setminus E}\) 与 \(N_{\setminus E}\) 的关系不再是一个干净的幂律。我们只能在局部把它近似为 \(N^*_{\setminus E} \overset{\propto}{\sim} C_{\setminus E}^g\)，其中 \(g\) 是基于一阶导数的局部指数，而不是全局幂律指数，于是 \(g = \frac{\mathrm{d} \log C_{\setminus E}}{\mathrm{d} \log N_{\setminus E}}\)。关于如何近似指数 \(g\) 的完整细节，请见
附录 A.1。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="局部幂律指数 \(g\) 如何随 \(C_{\setminus E}\) 增大而变化。"
srcset="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/pearce-1_hu_7056ca0bf9740f37.webp 320w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/pearce-1_hu_f85217da31a61bce.webp 480w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/pearce-1_hu_e6b046b4a7e9458d.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/pearce-1_hu_7056ca0bf9740f37.webp"
width="760"
height="501"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：局部幂律指数 \(g\) 如何随 \(C_{\setminus E}\) 增大而变化。图片来源：Pearce &amp;amp; Song 2024。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;如上图所示，随着 \(C_{\setminus E}\) 变大，\(g\) 会收敛到 Chinchilla 的估计值。他们用上面的方程生成合成训练曲线，并在 Kaplan et al. 中相同的模型规模范围，即 768M 到 1.5B 内估计出 \(g\) 接近 Kaplan 的系数 0.73。&lt;/p&gt;
&lt;h2 id="为什么是幂律"&gt;为什么是幂律？&lt;/h2&gt;
&lt;p&gt;幂律在 AI 之外的许多领域也被广泛观察到，例如
、
、
以及许多复杂系统。反复出现的模式是：大事件稀有，小事件常见，并且规模和频率之间的关系往往在 log-log 尺度上接近直线。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;为什么 LLM 缩放定律也呈现幂律形状？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;部分受到不同领域呈现不同指数这一观察的启发（
），一个早期解释来自
：他们假设语言建模可以看作是在低维数据流形上做回归。更多模型参数可以诱导对数据流形的更细分割，从而带来更小的泛化误差。最简单地说，如果有效规模为 \(N\) 的模型把一个 \(d\) 维流形划分成 \(O(N)\) 个区域，那么典型线性分辨率会按 \(\sim N^{-1/d}\) 缩放。这与上面的缩放定律有类似的幂律形式。这个理论在无限数据、欠拟合区域最干净，但现实中估计数据流形的内在维度很困难。&lt;/p&gt;
&lt;p&gt;另一个后来的假设（
，
）认为，知识或技能是以离散块的形式被学习的，即被“量化”，而这些技能的频率分布遵循幂律。模型先学习常见技能，再学习稀有技能，因此损失会呈现平滑的幂律下降。&lt;/p&gt;
&lt;p&gt;我这里只列出两个假设，但还有更多研究从数据谱尾、核特征值、自然语言统计特性或训练动力学相变等角度解释幂律缩放的形状。&lt;/p&gt;
&lt;h1 id="数据受限区域中的缩放定律"&gt;数据受限区域中的缩放定律&lt;/h1&gt;
&lt;p&gt;经典缩放定律假设有效上有无限的唯一数据、没有重复、没有多 epoch 训练。随着模型规模显著增长，我们正在耗尽足够高质量的唯一 token。事实上，关于 AI 缩放还能持续多久的一些争论，核心就在于我们是否正在撞上“数据墙”。&lt;/p&gt;
&lt;p&gt;也值得强调的是，\(D\) 背后的数据集预期已经被清洗过。预训练数据流水线通常是有效预训练流水线中的重要部分，常见步骤包括去重（精确和模糊）、质量过滤、样板文本移除、安全过滤、PII 和版权遮蔽、benchmark 去污染，以及基于语言、质量、内容类型等对数据混合成分进行仔细重加权。即便两个数据集拥有相同 token 数 \(D\)，一个高质量数据集和一个互联网垃圾数据集也可能带来截然不同的计算效率。&lt;/p&gt;
&lt;p&gt;
的研究关注一个受控版本：一个大部分唯一、但含有少量重复数据的数据集。从一个大数据集出发，数据混合中保留 90% 非重复内容，但用原始数据中很小一部分的重复样本替换剩余 10%。他们训练一个 Transformer 模型 100B token 后，观察到 double descent 现象：随着重复数据权重增加，测试损失会先变差，然后又变好，而且重复比例越大，这个效应越明显。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="测试损失随重复比例增加出现 double descent。"
srcset="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/hernandez-1_hu_1f244707c77774cb.webp 320w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/hernandez-1_hu_89baf478c1c48a7e.webp 480w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/hernandez-1_hu_d6adf5985af9f60a.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/hernandez-1_hu_1f244707c77774cb.webp"
width="760"
height="223"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：测试损失随重复比例增加出现 double descent，左侧重复比例为 90%，右侧为 50%。图片来源：Hernandez et al. 2022。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;训练中段的平坦或上升趋势，可能是由于模型记忆重复数据造成的。具有这种形状的学习曲线会让缩放定律拟合不那么准确。他们还总结说，重复数据会损害某些 OOD 评测和下游微调。不过，他们的数据混合是更偏实验室的构造，而现实世界中的重复往往更微妙，例如不同数据有不同重复水平，也可能存在语义重复。&lt;/p&gt;
&lt;p&gt;比起简单地说“数据重复会伤害训练”，我们更关心的是：当高质量唯一数据并非无限，而且训练中很可能必须重复数据时，该如何拟合缩放定律。&lt;/p&gt;
&lt;p&gt;
研究了在模型训练受数据约束时，应该如何最优分配计算量。具体来说，他们通过大约 400 个实验，经验研究数据重复的影响。模型范围为 10M 到 9B 参数，数据规模最高到 900B token，epoch 最高到 1500。每个 epoch 重复完全相同的数据集，epoch 之间打乱顺序，并在 held-out 测试集上评估。&lt;/p&gt;
&lt;p&gt;关键建模调整是把总 token 数 \(D\) 分解成两部分：（i）唯一 token 数 \(U_D\)，以及（ii）重复次数 \(R_D\)，也就是 epoch 数减 1。因此 \(D = U_D(1 + R_D)\)。给定唯一数据预算 \(D_\text{uniq}\)，按定义有 \(U_D = \min \{{ D_\text{uniq}, D\}}\)，且 \(R_D = (D / U_D) - 1\)。他们使用 Chinchilla 缩放定律找到拟合 \(U_D\) 的最优模型规模 \(U_N\)，并通过重复定义超额模型规模 \(R_N = (N / U_N) - 1\)。&lt;/p&gt;
&lt;p&gt;然后，他们更新 Chinchilla 的参数化拟合方法 3，用有效的、经过折扣的数据量 \(D'\) 和模型规模 \(N'\) 替代原始量：&lt;/p&gt;
\[
\hat{L}(N, D) = \frac{A}{N'^\alpha} + \frac{B}{D'^\beta} + E
\quad\text{ where }
D' = U_D + U_D\, r_D\left(1 - \exp\!\left(-\frac{R_D}{r_D}\right)\right).
\]&lt;p&gt;直觉是，一个 token 的价值会随着重复而指数衰减。在他们的建模中，每次重复都会让该 token 剩余价值损失 \((1 - 1/r_D)\) 的比例，其中 \(r_D\) 是可学习的“半衰期”参数。当 \(R_D = 0\) 或 \(R_D \ll r_D\) 时，我们恢复 \(D' \approx D\)。&lt;/p&gt;
&lt;p&gt;一个对称形式用于处理超额模型规模：\(N' = U_N + U_N r_N(1 - \exp(-R_N / r_N))\)。它刻画了“更大的模型会在重复数据上更快过拟合”，以及“一个模型可能对它的数据集来说太大”这些想法。这个部分不那么直观，我也没有找到令人满意的解释，说明为什么模型规模需要像重复数据一样以这种对称形式出现。后续
改变了这个假设。&lt;/p&gt;
&lt;p&gt;他们的经验拟合发现，超额参数的价值衰减速度比重复数据更快，即 \(r_N &lt; r_D\)，因此我们应该把更多资源分配给更多 epoch，而不是更多模型参数。这个建模的一个弱点，作者也指出过，是它会显著低估失败模型的最终测试损失，也就是训练中途损失开始上升的模型，例如训练 44 个 epoch 的模型。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="数据受限缩放模型比不考虑数据限制的拟合更好地捕捉实验结果。"
srcset="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/muennighoff-1_hu_733070d59e21a809.webp 320w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/muennighoff-1_hu_7a41ee59aa7405f9.webp 480w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/muennighoff-1_hu_346923ca9bab5f9b.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/muennighoff-1_hu_733070d59e21a809.webp"
width="760"
height="353"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：数据受限缩放模型比不考虑数据限制的拟合更好地捕捉实验结果；重复 token 的价值会指数衰减并趋向上限。随着 epoch 增多，拟合会变差，因为高度重复会导致测试损失在训练中途上升，但图中没有展示这一点。图片来源：Muennighoff et al. 2023。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;最近，
用另一种方法重新研究了同一个问题。与其把过参数化建模为有效模型规模上的边际收益递减，Lovelace et al. 显式建模模型规模 \(\times\) 数据重复之间的交互。经验上，他们训练了约 300 个模型，范围从 15M 到 1B 参数，以及从 50M 到 6B 唯一 token。&lt;/p&gt;
&lt;p&gt;当他们对固定模型规模绘制不同数据重复水平下的拟合残差时，观察很直观：epoch 越多，伤害越大；有趣的是，更大的模型对重复更敏感。这暗示损失惩罚很可能同时是模型规模和数据规模的函数。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="有效规模拟合的残差表明，过拟合伤害会随 epoch 数和模型规模同时增长。"
srcset="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/lovelace-1_hu_4a0382679a73393.webp 320w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/lovelace-1_hu_cb360931e0b06994.webp 480w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/lovelace-1_hu_83a34fd8e425409e.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/lovelace-1_hu_4a0382679a73393.webp"
width="760"
height="220"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：有效规模拟合的残差表明，过拟合伤害会随 epoch 数和模型规模同时增长。图片来源：Lovelace et al. 2026。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;他们引入了一个显式过拟合惩罚项，并围绕容量比 \(N / U_D\) 构造，也就是参数量相对于唯一 token 的比例：&lt;/p&gt;
\[
\hat{L}(N, U_D, R_D) = E + \frac{A}{N^\alpha} + \frac{B}{\big(U_D (1 + R_D)\big)^\beta} + \color{red}{P \cdot R_D^\delta \cdot \left(\frac{N}{U_D}\right)^\kappa}
\]&lt;p&gt;其中：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;\(R_D\) 是重复次数；&lt;/li&gt;
&lt;li&gt;标量 \(P\) 是可学习参数；&lt;/li&gt;
&lt;li&gt;指数 \(\kappa\) 是第二个可学习参数，让惩罚项可以随容量比 \(N / U_D\) 非线性变化；&lt;/li&gt;
&lt;li&gt;重复次数上的独立指数 \(\delta\) 是第三个可学习参数，它把重复的非线性从 \(\kappa\) 中解耦出来。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;红色新增项是一个直接的过拟合惩罚，它会随着数据重复次数，以及模型相对于可用唯一数据的过参数化程度一起增长。&lt;/p&gt;
&lt;p&gt;他们还做了一个关于 weight decay 如何影响数据受限训练的案例研究，发现更强的 weight decay 会降低数据重复导致的过拟合惩罚。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="强 weight decay 会降低数据重复带来的过拟合惩罚。"
srcset="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/lovelace-2_hu_571c8fe2c2fead56.webp 320w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/lovelace-2_hu_38a94ed0a3c70ca1.webp 480w, https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/lovelace-2_hu_c60eced0d79e610f.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/scaling-laws-carefully-zh-cn/lovelace-2_hu_571c8fe2c2fead56.webp"
width="760"
height="312"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：强 weight decay 会降低数据重复带来的过拟合惩罚。图片来源：Lovelace et al. 2026。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;Muennighoff et al. 和 Lovelace et al. 的两种建模方法都来自经验曲线拟合，因此我们仍然不清楚为什么数据受限缩放定律应该恰好有这些形式，也不清楚为什么每个自由参数都是必要的。我很好奇这个方向上是否会有更多理论工作。&lt;/p&gt;
&lt;h1 id="现实中拟合缩放定律的微妙之处"&gt;现实中拟合缩放定律的微妙之处&lt;/h1&gt;
&lt;p&gt;尽管缩放定律形式干净，但在实践中，它的拟合对一些看似琐碎的流程选择会出人意料地敏感，例如如何计算参数量、如何舍入精度、如何求和或平均损失等。&lt;/p&gt;
&lt;p&gt;原因是，缩放定律只能在我们负担得起训练的相对小、相对便宜的模型上拟合，而预测结果要外推到大好几个数量级的模型。在这种设定下，看起来像舍入误差的选择，可能会导致非常不同的预测。&lt;/p&gt;
&lt;p&gt;与此同时，缩放定律拟合假设唯一变化的因素是规模。这意味着模型架构、优化器、学习率计划、batch ramp、数据混合、tokenizer 和其他设计选择应该保持不变。另一个底层假设是，这些设置都已经被仔细调优，因为训练不足这类情况可能会导向不同结论。&lt;/p&gt;
&lt;p&gt;Kaplan et al. 和 Chinchilla 结果之间的分歧，就是展示缩放定律拟合微妙之处的一个例子。&lt;/p&gt;
&lt;p&gt;第二个例子是后续分析：为什么 Chinchilla 的方法 3 会与另外两种方法略有偏差？
从 Hoffmann et al. (2022) 的 Figure 4 中提取原始 \((N, D, L)\) 数据点，并重新运行方法 3 的参数化拟合。他们发现了几个具体问题：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;L-BFGS-B 最小化器中的损失尺度过高，这是由于对 Huber-loss 按样本平均而不是求和导致的，进而造成优化过早终止。原始拟合和 bootstrap 中的损失最小化提前停止，产生了不一致的估计值和不合理地窄的置信区间。&lt;/li&gt;
&lt;li&gt;报告的 \(\alpha\) 和 \(\beta\) 被舍入到 2 位小数，这让推导出的 \(A, B\) 看起来比实际偏差更大。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="玩具模拟"&gt;玩具模拟&lt;/h2&gt;
&lt;p&gt;下面是一个由 ChatGPT 创建的玩具模拟组件，用来展示三种具体失败模式。&lt;/p&gt;
&lt;p&gt;我们假设真实函数为：&lt;/p&gt;
\[
\hat{L}(N, D) = 482.01 \cdot N^{-0.3478} + 2085.43 D^{-0.3658} + 1.8172
\]&lt;p&gt;因此 \(N_\text{opt} \propto C^{0.5126}, D_\text{opt} \propto C^{0.4874}\)。这是
的估计。&lt;/p&gt;
&lt;p&gt;该模拟绘制损失预测 \(\hat{L}\) 相对于数据规模 \(D\) 的曲线，同时提供几组滑块来展示：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;损失精度：把损失从高精度舍入到低精度，会改变拟合得到的参数值。&lt;/li&gt;
&lt;li&gt;损失噪声：只用 milli-loss（0.001）量级的倍数扰动损失值，就会导致不同拟合。&lt;/li&gt;
&lt;li&gt;拟合区域敏感性：只拟合小模型、只拟合中等模型或拟合全部模型，会得到不同的表观缩放定律。&lt;/li&gt;
&lt;/ul&gt;
&lt;div class="scaling-widget" data-scaling-widget&gt;
&lt;style&gt;
.scaling-widget {
--sw-bg: #ffffff;
--sw-border: #d7dee8;
--sw-panel: #f8fafc;
--sw-text: #172033;
--sw-muted: #5f6b7a;
--sw-grid: #e6ebf2;
--sw-true: #64748b;
--sw-fit: #0f86b6;
--sw-point: #9ca3af;
--sw-highlight: #d97706;
box-sizing: border-box;
width: 100%;
margin: 1.75rem 0;
padding: 1rem;
border: 1px solid var(--sw-border);
border-radius: 8px;
background: var(--sw-bg);
color: var(--sw-text);
font-family: system-ui, -apple-system, BlinkMacSystemFont, "Segoe UI", sans-serif;
}
.dark .scaling-widget {
--sw-bg: #111827;
--sw-border: #334155;
--sw-panel: #172033;
--sw-text: #e5edf7;
--sw-muted: #a6b2c2;
--sw-grid: #273446;
--sw-true: #94a3b8;
--sw-fit: #38bdf8;
--sw-point: #64748b;
--sw-highlight: #f59e0b;
}
.scaling-widget * {
box-sizing: border-box;
}
.scaling-widget__title {
margin: 0 0 0.25rem;
font-size: 1rem;
font-weight: 700;
line-height: 1.35;
}
.scaling-widget__subtitle {
margin: 0 0 1rem;
color: var(--sw-muted);
font-size: 0.92rem;
line-height: 1.55;
}
.scaling-widget__plot-wrap {
width: 100%;
overflow: hidden;
border: 1px solid var(--sw-border);
border-radius: 8px;
background: var(--sw-panel);
}
.scaling-widget svg {
display: block;
width: 100%;
height: auto;
min-height: 300px;
}
.scaling-widget__bottom {
display: grid;
grid-template-columns: minmax(0, 1fr) minmax(14rem, 17rem);
gap: 1rem;
margin-top: 1rem;
align-items: start;
}
.scaling-widget__controls {
display: grid;
gap: 0.9rem;
padding: 0.9rem;
border: 1px solid var(--sw-border);
border-radius: 8px;
background: var(--sw-panel);
}
.scaling-widget__control label {
display: flex;
justify-content: space-between;
gap: 0.75rem;
margin-bottom: 0.25rem;
color: var(--sw-text);
font-size: 0.9rem;
font-weight: 650;
line-height: 1.35;
}
.scaling-widget__control span {
white-space: nowrap;
color: var(--sw-muted);
font-variant-numeric: tabular-nums;
font-weight: 600;
}
.scaling-widget__control small {
display: block;
margin-top: 0.25rem;
color: var(--sw-muted);
font-size: 0.8rem;
line-height: 1.45;
}
.scaling-widget input,
.scaling-widget select {
width: 100%;
min-height: 2rem;
color: var(--sw-text);
accent-color: var(--sw-fit);
}
.scaling-widget__readout {
height: 100%;
padding: 0.9rem;
border: 1px solid var(--sw-border);
border-radius: 8px;
background: var(--sw-panel);
font-size: 0.9rem;
line-height: 1.65;
}
.scaling-widget__readout strong {
color: var(--sw-text);
}
.scaling-widget__readout code {
color: var(--sw-highlight);
font-size: 0.86em;
}
@media (max-width: 760px) {
.scaling-widget {
padding: 0.8rem;
}
.scaling-widget__bottom {
grid-template-columns: 1fr;
}
.scaling-widget svg {
min-height: 240px;
}
}
&lt;/style&gt;
&lt;p class="scaling-widget__title"&gt;缩放律拟合玩具模拟&lt;/p&gt;
&lt;p class="scaling-widget__subtitle"&gt;
调整损失精度、噪声和拟合区域，观察一个看似很小的实验处理选择如何改变外推出来的缩放指数。
&lt;/p&gt;
&lt;div class="scaling-widget__plot-wrap"&gt;
&lt;svg viewBox="0 0 820 430" role="img" aria-label="损失和数据规模之间的缩放律拟合曲线" data-plot&gt;&lt;/svg&gt;
&lt;/div&gt;
&lt;div class="scaling-widget__bottom"&gt;
&lt;div class="scaling-widget__controls"&gt;
&lt;div class="scaling-widget__control"&gt;
&lt;label for="sw-precision"&gt;损失精度 &lt;span data-precision-label&gt;4 位小数&lt;/span&gt;&lt;/label&gt;
&lt;select id="sw-precision" data-precision&gt;
&lt;option value="4"&gt;4 位小数&lt;/option&gt;
&lt;option value="3"&gt;3 位小数&lt;/option&gt;
&lt;option value="2"&gt;2 位小数&lt;/option&gt;
&lt;option value="1"&gt;1 位小数&lt;/option&gt;
&lt;/select&gt;
&lt;small&gt;把观测损失四舍五入得更粗，会改变拟合出的参数。&lt;/small&gt;
&lt;/div&gt;
&lt;div class="scaling-widget__control"&gt;
&lt;label for="sw-noise"&gt;损失噪声 &lt;span data-noise-label&gt;0.000&lt;/span&gt;&lt;/label&gt;
&lt;input id="sw-noise" data-noise type="range" min="0" max="6" step="1" value="0"&gt;
&lt;small&gt;模拟 milli-loss 量级的测量扰动。&lt;/small&gt;
&lt;/div&gt;
&lt;div class="scaling-widget__control"&gt;
&lt;label for="sw-region"&gt;拟合区域 &lt;span data-region-label&gt;全部模型&lt;/span&gt;&lt;/label&gt;
&lt;select id="sw-region" data-region&gt;
&lt;option value="all"&gt;全部模型&lt;/option&gt;
&lt;option value="small"&gt;只用小模型&lt;/option&gt;
&lt;option value="medium"&gt;只用中等模型&lt;/option&gt;
&lt;/select&gt;
&lt;small&gt;只在较小尺度上拟合，然后外推到大模型，误差会被放大。&lt;/small&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div class="scaling-widget__readout" data-readout&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;script&gt;
(() =&gt; {
const root = document.currentScript.previousElementSibling;
if (!root || root.dataset.ready === "true") return;
root.dataset.ready = "true";
const svg = root.querySelector("[data-plot]");
const precision = root.querySelector("[data-precision]");
const noise = root.querySelector("[data-noise]");
const region = root.querySelector("[data-region]");
const precisionLabel = root.querySelector("[data-precision-label]");
const noiseLabel = root.querySelector("[data-noise-label]");
const regionLabel = root.querySelector("[data-region-label]");
const readout = root.querySelector("[data-readout]");
const A = 482.01;
const B = 2085.43;
const E = 1.8172;
const alpha = 0.3478;
const beta = 0.3658;
const fixedN = 1e9;
const Ds = [5e7, 9e7, 1.6e8, 3e8, 5e8, 9e8, 1.6e9, 3e9, 5e9, 9e9, 1.6e10, 3e10, 6e10];
const regionText = { all: "全部模型", small: "只用小模型", medium: "只用中等模型" };
function loss(n, d, a = alpha, b = beta, offset = E) {
return A * Math.pow(n, -a) + B * Math.pow(d, -b) + offset;
}
function perturb(index, noiseLevel) {
return (Math.sin(index * 2.17) + Math.cos(index * 0.71)) * noiseLevel * 0.001;
}
function fittedParams() {
const p = Number(precision.value);
const n = Number(noise.value);
const r = region.value;
let a = alpha;
let b = beta;
let offset = E;
if (r === "small") {
a -= 0.035;
b += 0.046;
offset += 0.018;
} else if (r === "medium") {
a += 0.022;
b -= 0.029;
offset -= 0.009;
}
const rounding = 4 - p;
a += rounding * 0.006 - n * 0.0017;
b -= rounding * 0.007 + n * 0.0012;
offset += rounding * 0.006 + n * 0.002;
return { a, b, offset };
}
function roundLoss(value, digits) {
const scale = Math.pow(10, digits);
return Math.round(value * scale) / scale;
}
function draw() {
const digits = Number(precision.value);
const noiseLevel = Number(noise.value);
const fit = fittedParams();
const xs = Ds.map(d =&gt; Math.log10(d));
const trueYs = Ds.map((d, i) =&gt; loss(fixedN, d) + perturb(i, noiseLevel));
const observed = trueYs.map(y =&gt; roundLoss(y, digits));
const fitYs = Ds.map(d =&gt; loss(fixedN, d, fit.a, fit.b, fit.offset));
const allY = trueYs.concat(observed, fitYs);
const xMin = Math.min(...xs);
const xMax = Math.max(...xs);
const yMin = Math.min(...allY) - 0.015;
const yMax = Math.max(...allY) + 0.015;
const W = 820;
const H = 430;
const margin = { left: 68, right: 28, top: 32, bottom: 58 };
const plotW = W - margin.left - margin.right;
const plotH = H - margin.top - margin.bottom;
const sx = x =&gt; margin.left + ((x - xMin) / (xMax - xMin)) * plotW;
const sy = y =&gt; margin.top + (1 - ((y - yMin) / (yMax - yMin))) * plotH;
const linePath = ys =&gt; xs.map((x, i) =&gt; `${i ? "L" : "M"} ${sx(x).toFixed(1)} ${sy(ys[i]).toFixed(1)}`).join(" ");
const gridX = [8, 9, 10];
const gridY = Array.from({ length: 5 }, (_, i) =&gt; yMin + (i / 4) * (yMax - yMin));
svg.innerHTML = `
&lt;rect x="0" y="0" width="${W}" height="${H}" fill="transparent"&gt;&lt;/rect&gt;
${gridX.map(x =&gt; `&lt;line x1="${sx(x)}" x2="${sx(x)}" y1="${margin.top}" y2="${H - margin.bottom}" stroke="var(--sw-grid)" /&gt;`).join("")}
${gridY.map(y =&gt; `&lt;line x1="${margin.left}" x2="${W - margin.right}" y1="${sy(y)}" y2="${sy(y)}" stroke="var(--sw-grid)" /&gt;`).join("")}
&lt;line x1="${margin.left}" x2="${W - margin.right}" y1="${H - margin.bottom}" y2="${H - margin.bottom}" stroke="var(--sw-muted)" /&gt;
&lt;line x1="${margin.left}" x2="${margin.left}" y1="${margin.top}" y2="${H - margin.bottom}" stroke="var(--sw-muted)" /&gt;
${gridX.map(x =&gt; `&lt;text x="${sx(x)}" y="${H - 22}" text-anchor="middle" fill="var(--sw-muted)" font-size="13"&gt;1e${x}&lt;/text&gt;`).join("")}
${gridY.map(y =&gt; `&lt;text x="${margin.left - 10}" y="${sy(y) + 4}" text-anchor="end" fill="var(--sw-muted)" font-size="12"&gt;${y.toFixed(3)}&lt;/text&gt;`).join("")}
&lt;text x="${W / 2}" y="${H - 6}" text-anchor="middle" fill="var(--sw-muted)" font-size="13"&gt;数据规模 D（log10）&lt;/text&gt;
&lt;text x="18" y="${H / 2}" text-anchor="middle" transform="rotate(-90 18 ${H / 2})" fill="var(--sw-muted)" font-size="13"&gt;预测损失&lt;/text&gt;
&lt;path d="${linePath(trueYs)}" fill="none" stroke="var(--sw-true)" stroke-width="2.4" stroke-dasharray="6 6" /&gt;
&lt;path d="${linePath(fitYs)}" fill="none" stroke="var(--sw-fit)" stroke-width="3" /&gt;
${observed.map((y, i) =&gt; `&lt;circle cx="${sx(xs[i])}" cy="${sy(y)}" r="4" fill="var(--sw-point)" stroke="var(--sw-bg)" stroke-width="1.5" /&gt;`).join("")}
&lt;g transform="translate(${W - 255} 34)"&gt;
&lt;rect width="225" height="72" rx="8" fill="var(--sw-bg)" stroke="var(--sw-border)" /&gt;
&lt;line x1="14" x2="52" y1="22" y2="22" stroke="var(--sw-true)" stroke-width="2.4" stroke-dasharray="6 6" /&gt;
&lt;text x="62" y="26" fill="var(--sw-muted)" font-size="13"&gt;真实函数&lt;/text&gt;
&lt;line x1="14" x2="52" y1="48" y2="48" stroke="var(--sw-fit)" stroke-width="3" /&gt;
&lt;text x="62" y="52" fill="var(--sw-muted)" font-size="13"&gt;拟合外推&lt;/text&gt;
&lt;/g&gt;
`;
const nExp = fit.b / (fit.a + fit.b);
const dExp = fit.a / (fit.a + fit.b);
precisionLabel.textContent = `${digits} 位小数`;
noiseLabel.textContent = (noiseLevel * 0.001).toFixed(3);
regionLabel.textContent = regionText[region.value];
readout.innerHTML = `
&lt;strong&gt;当前拟合结果&lt;/strong&gt;&lt;br&gt;
&lt;code&gt;alpha = ${fit.a.toFixed(4)}&lt;/code&gt;&lt;br&gt;
&lt;code&gt;beta = ${fit.b.toFixed(4)}&lt;/code&gt;&lt;br&gt;
&lt;code&gt;N_opt ∝ C^${nExp.toFixed(4)}&lt;/code&gt;&lt;br&gt;
&lt;code&gt;D_opt ∝ C^${dExp.toFixed(4)}&lt;/code&gt;&lt;br&gt;&lt;br&gt;
真实函数对应的指数约为 &lt;code&gt;N_opt ∝ C^0.5126&lt;/code&gt;、&lt;code&gt;D_opt ∝ C^0.4874&lt;/code&gt;。微小的损失处理差异，在远距离外推时会显得很大。
`;
}
[precision, noise, region].forEach(el =&gt; {
el.addEventListener("input", draw);
el.addEventListener("change", draw);
});
draw();
})();
&lt;/script&gt;
&lt;h1 id="引用"&gt;引用&lt;/h1&gt;
&lt;p&gt;请按如下方式引用原文：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;Weng, Lilian. &amp;ldquo;Scaling Laws, Carefully&amp;rdquo;. Lil&amp;rsquo;Log (Jun 2026).
&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;或使用 BibTeX：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bibtex" data-lang="bibtex"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nc"&gt;@article&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;weng2026scaling&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;title&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Scaling Laws, Carefully}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;author&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Weng, Lilian}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;journal&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{lilianweng.github.io}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;year&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{2026}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;month&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{June}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;url&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;&amp;#34;https://lilianweng.github.io/posts/2026-06-24-scaling-laws/&amp;#34;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h1 id="参考文献"&gt;参考文献&lt;/h1&gt;
&lt;p&gt;[1] S. Amari, N. Fujita, and S. Shinomoto.
4(4):605-618, 1992.&lt;/p&gt;
&lt;p&gt;[2] Hestness et al.
arXiv preprint arXiv:1712.00409, 2017.&lt;/p&gt;
&lt;p&gt;[3] Rosenfeld et al.
ICLR 2020.&lt;/p&gt;
&lt;p&gt;[4] Kaplan et al.
arXiv preprint arXiv:2001.08361, 2020.&lt;/p&gt;
&lt;p&gt;[5] Hoffmann et al.
NeurIPS 2022.&lt;/p&gt;
&lt;p&gt;[6] Pearce and Song.
TMLR 2024.&lt;/p&gt;
&lt;p&gt;[7] Bahri et al.
arXiv preprint arXiv:2102.06701, 2021.&lt;/p&gt;
&lt;p&gt;[8] Sharma and Kaplan.
arXiv preprint arXiv:2004.10802, 2020.&lt;/p&gt;
&lt;p&gt;[9] Hernandez et al.
arXiv preprint arXiv:2205.10487, 2022.&lt;/p&gt;
&lt;p&gt;[10] Muennighoff et al.
NeurIPS 2023.&lt;/p&gt;
&lt;p&gt;[11] Lovelace et al.
arXiv preprint arXiv:2605.01640, 2026.&lt;/p&gt;
&lt;p&gt;[12] Besiroglu et al.
arXiv preprint arXiv:2404.10102, 2024.&lt;/p&gt;
&lt;p&gt;[13] Michaud et al.
NeurIPS 2023.&lt;/p&gt;
&lt;p&gt;[14] Brill.
arXiv preprint arXiv:2412.07942, 2024.&lt;/p&gt;
&lt;p&gt;[15] Rae et al.
arXiv preprint arXiv:2112.11446, 2021.&lt;/p&gt;</description></item><item><title>预训练去想象，微调去行动：世界-动作模型的兴起</title><link>https://tuagoale.github.io/learning/world-action-models-zh-cn/</link><pubDate>Mon, 15 Jun 2026 00:00:00 +0000</pubDate><guid>https://tuagoale.github.io/learning/world-action-models-zh-cn/</guid><description>
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;原文：Moritz Reuss,
, NVIDIA Technical Blog, June 15, 2026。本文为中文译文，保留原文主要结构、图示和引用编号；文末附有原文 Sources 与 BibTeX。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;details&gt;
&lt;summary&gt;给不熟悉 VLA / WAM 术语的读者准备的速查表&lt;/summary&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;术语&lt;/th&gt;
&lt;th&gt;含义&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;VLA&lt;/td&gt;
&lt;td&gt;Vision-Language-Action model，视觉-语言-动作模型。它通常从预训练的 VLM backbone 出发，再适配成一个能根据视觉观测和语言指令生成动作的机器人策略。大规模 VLM 预训练是这条路线的核心部分，可参考 Pi-0 和 GR00T N1。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;WAM&lt;/td&gt;
&lt;td&gt;World-Action Model，世界-动作模型。它从预训练的世界模型或视频 backbone 出发，让模型表示或预测场景如何随时间变化，同时输出对应动作。本文统一使用 WAM 这个术语。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;VLM&lt;/td&gt;
&lt;td&gt;Vision-Language Model，视觉-语言模型。它在图文或视频文本数据上预训练，生成与视觉输入相关联的语言输出，之后通常再被适配到机器人控制。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Video backbone&lt;/td&gt;
&lt;td&gt;被复用为机器人策略核心表征或生成器的预训练视频模型。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;World model&lt;/td&gt;
&lt;td&gt;根据语言、机器人动作或 latent action 等动作抽象，预测未来世界状态的模型。预测状态可以是图像、视频、点轨迹、物体状态或 latent features。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Grounding&lt;/td&gt;
&lt;td&gt;把符号，例如语言指令里的词，连接到能满足这些符号的感知对象和运动指令上。language-to-action grounding 指的是把“拿起红色杯子”这样的指令，转成实际完成任务所需的视觉感知与电机命令。grounding gap 就是模型知道语言含义与它能可靠改变物理世界之间的缺口。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Inverse dynamics&lt;/td&gt;
&lt;td&gt;给定当前观测 \(o_t\) 和未来观测 \(o_{t+k}\)，推断最可能产生这个转变的动作或动作序列。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Joint prediction&lt;/td&gt;
&lt;td&gt;给定 \(o_t\) 和语言 \(l_t\)，训练同一个策略 \(\pi(o_t,l_t)\)，同时预测未来观测 \(o_{t+1:t+k}\) 和动作 \(a_{t:t+k}\)。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Action chunk&lt;/td&gt;
&lt;td&gt;一段短时域动作序列 \(a_{t:t+k}\)，也就是 \(k\) 个动作 \(a_t, a_{t+1}, \dots, a_{t+k-1}\)，例如关节命令、末端执行器位移和夹爪状态。模型一次调用就预测整个 chunk。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Mixture-of-Transformers (MoT)&lt;/td&gt;
&lt;td&gt;多个面向不同模态的 transformer 或 expert，例如视频 transformer 和动作 transformer，通过共享 attention 连接，但各自保留独立权重。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Diffusion Transformer (DiT)&lt;/td&gt;
&lt;td&gt;diffusion 或 flow-matching 模型中的 transformer backbone，用来通过多步去噪生成图像、视频或动作 token。DiT 常用 adaptive layer normalization 注入时间步条件。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;VAE&lt;/td&gt;
&lt;td&gt;Variational Autoencoder。本文主要指图像和视频 VAE，它们在生成或策略学习前把高分辨率图像/视频压缩到 latent 表征，以大幅减少 token 数。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Wan&lt;/td&gt;
&lt;td&gt;一族大型预训练视频生成模型，最近常被用作 WAM 的视频 backbone。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Cosmos&lt;/td&gt;
&lt;td&gt;NVIDIA 的 physical AI 世界基础模型家族，包括可适配到机器人和策略学习的视频预测模型。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DROID&lt;/td&gt;
&lt;td&gt;Distributed Robot Interaction Dataset，大规模真实世界操作数据集，包含 50k+ demonstration，覆盖多样任务，由 Franka Panda 机械臂采集。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RoboArena&lt;/td&gt;
&lt;td&gt;分布式真实世界 benchmark，用于评估通用机器人策略在开放语言条件任务上的表现。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RoboLab&lt;/td&gt;
&lt;td&gt;高保真仿真 benchmark，用于分析 task-generalist robot policy 的视觉、关系和程序性能力。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;CALVIN&lt;/td&gt;
&lt;td&gt;面向长时域任务序列的语言条件操作 benchmark，运行在仿真环境中。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;LIBERO&lt;/td&gt;
&lt;td&gt;研究机器人操作中的知识迁移、终身学习和泛化能力的 benchmark。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;RoboTwin&lt;/td&gt;
&lt;td&gt;面向强 domain randomization 下双臂操作的数据生成器和 benchmark。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FAST / BEAST&lt;/td&gt;
&lt;td&gt;离散动作 tokenization 方法，把连续机器人动作转成 token 序列，让动作学习更接近 VLM 风格训练。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;VPP&lt;/td&gt;
&lt;td&gt;Video Prediction Policy，一类 WAM 风格方法，使用视频模型的预测视觉表征来条件化机器人动作。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;LAPA&lt;/td&gt;
&lt;td&gt;Latent Action Pretraining from Videos，不依赖真实机器人动作标签、从视频中学习 action-like latent variable 的方法。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;OOD&lt;/td&gt;
&lt;td&gt;Out-of-distribution，训练或 demonstration 样本之外的任务、物体、环境或指令。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FLOP / ZFLOP&lt;/td&gt;
&lt;td&gt;浮点运算量。1 ZFLOP = \(10^{21}\) FLOPs。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;H100 / GPU-hour&lt;/td&gt;
&lt;td&gt;H100 是 NVIDIA 高端训练 GPU；GPU-hour 是一块 GPU 运行一小时的粗略成本单位。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;BF16&lt;/td&gt;
&lt;td&gt;Brain floating point 16-bit，训练大型神经网络时常用的低精度数值格式。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;I2V&lt;/td&gt;
&lt;td&gt;Image-to-video，以初始图像或初始帧为条件的视频生成设置。&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;/details&gt;
&lt;p&gt;&lt;strong&gt;背景：两个基本模块。&lt;/strong&gt; 视觉运动策略把当前观测加目标或指令映射到机器人动作。世界模型则从当前世界状态加动作或目标抽象出发，预测未来视觉状态或 latent 状态。WAM 位于两者交叉处：它把预训练视频/世界模型 backbone 当作先验，同时预测未来状态和机器人动作。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="视觉运动策略：语言指令和当前观测输入，动作序列输出。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/visuomotor-policy_hu_54aa97f420d85e4b.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/visuomotor-policy_hu_c2fc27b81dc3406f.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/visuomotor-policy_hu_dd7d645ef343f178.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/visuomotor-policy_hu_54aa97f420d85e4b.webp"
width="760"
height="204"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：视觉运动策略。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="世界模型：当前世界状态加动作抽象输入，未来图像或 latent 输出。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/world-model_hu_485378204ccd5804.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/world-model_hu_783a44ab5220029b.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/world-model_hu_f11d680fee4264c9.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/world-model_hu_485378204ccd5804.webp"
width="760"
height="204"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图：世界模型。&lt;/em&gt;&lt;/p&gt;
&lt;h2 id="引言"&gt;引言&lt;/h2&gt;
&lt;p&gt;去年，我的 Scholar Inbox 摘要几乎每天都被新的 VLA 论文占据。但过去几个月里，另一个关键词也开始几乎每天出现：WAM，也就是 World-Action Model。2025 年 10 月，我在 State of VLA 那篇文章里还写过，WAM 只是 VLA 研究中的一个小分支，远没有从 VLM 初始化而来的 VLA 流行 &lt;a href="#source-60"&gt;[60]&lt;/a&gt;。这个局面变得很快，而我当时希望看到更多这类工作的愿望已经成了现实。&lt;/p&gt;
&lt;p&gt;那么，究竟发生了什么？为什么是现在？也许只是因为 WAM 是大家都想追的新热点；也可能是 VLA 作者已经把各种 “-VLA” 名字用得差不多了，例如 X-VLA、Ego-VLA 这类名字几乎都被占了，所以现在可以把命名空间回收给 WAM。但更可能的原因是，基于 VLM 的 VLA 开始卡住了。现代 VLA 从大规模视觉语言预训练中获益很多，但仍然会撞上语言到动作的 grounding wall。把语言和像素映射成行为这个问题，仍然必须从机器人数据中学习。WAM 提供了另一个起点：它们使用预训练视频或世界模型 backbone，而这些 backbone 已经在语言条件下建模了场景动力学如何变化。如果这种先验能迁移到行为生成，那么剩下的视频到动作缺口，可能比直接学习语言到动作 grounding 更小。&lt;/p&gt;
&lt;p&gt;不过，WAM 背后的想法并不新。UniPi &lt;a href="#source-10"&gt;[10]&lt;/a&gt; 这样的早期 WAM 在 2023 年就已经提出了本质上类似的方法。那么，为什么这个范式要过几年才进入机器人基础模型的主流？今天它到底走到了哪一步？本文会更仔细地梳理现代 WAM 版图，并回答一个核心问题：&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;核心问题：&lt;/strong&gt; WAM 是研究和工业中的真实范式转移，还是一次短暂的 hype cycle？如果这套 recipe 真那么有效，为什么在 UniPi 这样的早期论文之后，还要好几年才变得流行？&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;我的判断是：WAM 会成为机器人基础模型的第二条主要 recipe，与基于 VLM 的 VLA 并列。开放问题在于，哪一种 WAM 形式会胜出，以及模型架构和训练 pipeline 里的哪些部分真正重要。最终赢家很可能既不是纯 VLA，也不是纯 WAM，而是两者的混合体。&lt;/p&gt;
&lt;p&gt;下面是我对现代 WAM 空间的地图：如何分类和理解 WAM、早期模型之后发生了什么变化、以及当前结果与 VLA 相比如何。更宽泛的综述可以参考 NTU 最近的 “World Model for Robot Learning: A Comprehensive Survey” &lt;a href="#source-57"&gt;[57]&lt;/a&gt;，它从仿真、评估、导航和自动驾驶等方向整理了机器人学习中的世界模型。&lt;/p&gt;
&lt;h2 id="面向通用策略的两种表示押注"&gt;面向通用策略的两种表示押注&lt;/h2&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="通用操作策略的两种主要押注：基于 VLM 的 VLA 与基于视频 backbone 的 WAM。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/two-representation-bets_hu_2e0a8b59bb64452d.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/two-representation-bets_hu_c6ea7012a13c2abb.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/two-representation-bets_hu_8214818b87743ee7.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/two-representation-bets_hu_2e0a8b59bb64452d.webp"
width="760"
height="745"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 1：通用操作策略的两种主要押注：基于 VLM 的 VLA 与基于视频 backbone 的 WAM。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;当前，研究界和工业界的机器人基础模型大致有两种主要表示路线。很多团队沿着 Pi-0 &lt;a href="#source-2"&gt;[2]&lt;/a&gt; 建立、后来由 Pi-0.5 &lt;a href="#source-4"&gt;[4]&lt;/a&gt; 改进的传统 VLA recipe 往前推进，把 VLM backbone 作为策略学习起点。这个 VLM-backbone recipe 已经出现在 NVIDIA GR00T &lt;a href="#source-5"&gt;[5]&lt;/a&gt;、Xiaomi Robotics &lt;a href="#source-27"&gt;[27]&lt;/a&gt;、Being-H0.5 &lt;a href="#source-28"&gt;[28]&lt;/a&gt; 等公开工作中。&lt;/p&gt;
&lt;p&gt;最近，另一种范式开始出现：把预训练视频 backbone 用作通向通用操作的另一条路径。公开例子包括 NVIDIA 的 DreamZero &lt;a href="#source-8"&gt;[8]&lt;/a&gt; 和 Cosmos Policy &lt;a href="#source-13"&gt;[13]&lt;/a&gt;、Ant Group 的 LingBot-VA &lt;a href="#source-9"&gt;[9]&lt;/a&gt;、Rhoda AI 的 DVA &lt;a href="#source-40"&gt;[40]&lt;/a&gt;、Sereact 的 Cortex 2.0 &lt;a href="#source-45"&gt;[45]&lt;/a&gt;，以及 Mimic Robotics 的 mimic-video &lt;a href="#source-14"&gt;[14]&lt;/a&gt;。与此同时，很多大学实验室和开放研究团队也在用新想法推进边界，包括 Video Prediction Policy &lt;a href="#source-24"&gt;[24]&lt;/a&gt;、Unified Video Action Model &lt;a href="#source-39"&gt;[39]&lt;/a&gt; 和 Fast-WAM &lt;a href="#source-23"&gt;[23]&lt;/a&gt;。&lt;/p&gt;
&lt;p&gt;Backbone 的选择会影响整个训练与评估 pipeline，从训练 recipe、数据混合，到推理优化都会变。考虑到大规模运行这些模型的成本，多数团队很可能必须先押注一个方向，VLA 或 WAM，而不是同时完整追两条线。哪条路会证明自己，或者两条路是否会汇合，现在仍然开放。如果今天下注，你会押哪边？下面我们更深入地看这个决策的两面。&lt;/p&gt;
&lt;h2 id="为什么是-world-action-models一些假设"&gt;为什么是 World-Action Models？一些假设&lt;/h2&gt;
&lt;p&gt;在深入当前模型之前，我们先回顾为什么 WAM 作为 VLM-based VLA 的替代方案很有吸引力。理解这一点，也需要先把 WAM 放进机器人世界模型的更大图景里。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="机器人中的世界模型。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/world-models-in-robotics_hu_7992a77de5666d92.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/world-models-in-robotics_hu_cca814ece602edea.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/world-models-in-robotics_hu_aeb93570afe5acb.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/world-models-in-robotics_hu_7992a77de5666d92.webp"
width="760"
height="377"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 2：机器人中的世界模型。Action-conditioned world model，例如 DreamDojo、Genie、JEPA-WM，从学习到的动作抽象预测未来状态；视频世界模型，例如 Cosmos-3、WAN、Veo、LTX-Video，根据语言和参考帧预测未来视频；DreamZero、LingBot-VA、UniPi 和 mimic-Video 这样的 WAM 位于二者交叉处：它们在会输出动作的机器人策略内部复用视频或世界模型 backbone。&lt;/em&gt;&lt;/p&gt;
&lt;h3 id="grounding-gap"&gt;Grounding gap&lt;/h3&gt;
&lt;p&gt;要理解 WAM 为什么有吸引力，先要理解构建在 VLM backbone 上的“经典” VLA 的核心挑战。最早的 VLA 动机，是把 VLM 在互联网规模数据上学到的知识用于机器人。VLM 在海量图文数据上训练，并在很多视觉任务上表现出显著的 zero-shot 能力。VLA recipe 随后把这些预训练表征适配到动作生成。&lt;/p&gt;
&lt;p&gt;然而，VLM 预训练和具身操作之间存在巨大的 domain gap。几篇 VLA 论文观察到预训练 VLM 能力下降，或者专门设计方法绕开这个问题，尤其是当动作学习目标与原始 VLM 目标差异很大时。VLM2VLA 直接把这件事称作从 VLM 到 VLA 转换过程中的 catastrophic forgetting &lt;a href="#source-51"&gt;[51]&lt;/a&gt;。Knowledge Insulation 也报告了类似发现，并把担忧落实到架构上：它把 flow-matching 动作 expert 的梯度与 VLM backbone 隔离，以保留预训练语言/视觉知识，从而改善训练收敛、任务表现和语言跟随能力 &lt;a href="#source-20"&gt;[20]&lt;/a&gt;。&lt;/p&gt;
&lt;p&gt;VLM co-training 和离散动作 tokenizer 等近期方案确实有帮助，但核心挑战仍然存在：如何用有限机器人数据，把语言 grounded 到物理动作中。后文现代 VLA baseline 一节会再讨论这些解决方案。&lt;/p&gt;
&lt;p&gt;这自然引出一个问题：如果我们从一个已经表示“语言如何映射到世界中的视觉变化”的 backbone 出发，会怎样？&lt;/p&gt;
&lt;h3 id="wam-作为策略表征的核心假设"&gt;WAM 作为策略表征的核心假设&lt;/h3&gt;
&lt;p&gt;核心想法很简单：不要用 VLM backbone 来启动 imitation learning，而是使用预训练视频 backbone。当前视频模型在大规模视频语料上训练，学习视觉场景如何演化的时空表征。关键是，现在的视频模型常常是 text-conditioned 的：它们被训练成根据精确语言描述生成视频，有时还会附带参考帧，有时则完全从文本出发。&lt;/p&gt;
&lt;p&gt;许多视频中包含有意图的行为：手伸向物体、工具移动、物体被操作、场景因为某人或某物的行动而变化。这让视频 backbone 作为通用操作的模型先验很有吸引力。在看到任何机器人动作之前，backbone 已经编码了语言、视觉变化和合理物体交互之间的联系。后面的 Veo 3.1 演示就是一个快速例子。&lt;/p&gt;
&lt;p&gt;我会把下面三点看成假设，而不是结论。它们是在论文、同行讨论和我自己对领域的观察中反复出现的主张，有定性直觉、仿真证据和一些早期真实世界信号支持，但目前还没有干净的 matched comparison：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;预测未来世界变化与生成必要动作相关。&lt;/strong&gt; 逆动力学预测通常比纯动作生成更容易 &lt;a href="#source-26"&gt;[26]&lt;/a&gt;。如果已知想要的结果，推断产生这个结果的动作通常比直接从指令和当前观测预测动作更简单。Pi-0.7 的 visual subgoal 结果也指向同一方向：当策略得到目标未来图像时，动作预测更直接，训练收敛更快 &lt;a href="#source-41"&gt;[41]&lt;/a&gt;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;视频预训练提供了语言与物理变化之间的 grounding。&lt;/strong&gt; 视频模型学习把文本描述映射到视觉结果。如果这种能力能迁移到机器人，就可能减少必须从机器人 demonstration 中学习的 grounding 量。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;视频数据能正则化机器人策略。&lt;/strong&gt; 与 web-scale 视频相比，机器人数据集很小。无论是先在视频上预训练，还是在 robot data 旁边 co-train 视频，广义视觉先验都可能减少过拟合；收益取决于数据集、目标和架构。DreamZero &lt;a href="#source-8"&gt;[8]&lt;/a&gt; 和 Fast-WAM &lt;a href="#source-23"&gt;[23]&lt;/a&gt; 都表明，在机器人微调期间，当动作学习和视频预测目标共同训练时，WAM 表现最好。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="一个快速实验前沿视频模型已经理解多少机器人操作"&gt;一个快速实验：前沿视频模型已经“理解”多少机器人操作？&lt;/h3&gt;
&lt;p&gt;在加上任何机器人专用动作头之前，现代视频模型已经捕捉到了多少东西？我们用 Google 的前沿视频生成模型 Veo 3.1 做了一个简单实验。给定 DROID 设置中 RoboArena 烤面包机任务的一张原始 rollout 上下文帧，我们提示 Veo 去按下烤面包机拨杆，也就是 reference task，与原始 DROID demonstration 匹配；然后再让它拿起左侧的橙子，也就是超出 demonstration 的 composed extension。&lt;/p&gt;
&lt;p&gt;这段视频非常不可能在 Veo 预训练数据中，但我们无法直接验证训练集；因此要把它当成对先验的定性检查，而不是训练集成员关系的受控 probe。实验是一次性尝试，没有 prompt optimization。&lt;/p&gt;
&lt;p&gt;使用的 prompt 大意是：给定这张初始帧，生成一段机器人手臂按下烤面包机拨杆的视频。完成后，机器人应该拿起烤面包机左侧的橙子，并在拿起后停止。&lt;/p&gt;
&lt;p&gt;上下文帧与真实 rollout：&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="DROID 设置中 RoboArena 烤面包机任务的上下文帧。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/roboarena-context_hu_1d6ae4dff10d8480.webp 300w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/roboarena-context_hu_1d6ae4dff10d8480.webp"
width="300"
height="242"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 3：DROID 设置中 RoboArena 烤面包机任务的上下文帧。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="真实 rollout：机器人按下烤面包机拨杆。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/ground-truth-rollout_hu_e5ff072ff1ecb6bb.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/ground-truth-rollout_hu_12db515e20a119b6.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/ground-truth-rollout_hu_644bca8e0065176c.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/ground-truth-rollout_hu_e5ff072ff1ecb6bb.webp"
width="760"
height="188"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 4：真实 rollout：机器人按下烤面包机拨杆。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;Veo 3.1 生成的 rollout（zero-shot，没有机器人微调）：&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Veo 3.1 在 reference task 上的 rollout。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/veo-reference_hu_88cc3fb3a6a9c16c.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/veo-reference_hu_d273b6dc48165b2b.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/veo-reference_hu_7cdbc80fef62e4b8.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/veo-reference_hu_88cc3fb3a6a9c16c.webp"
width="760"
height="151"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 5：Veo 3.1 在 reference task（按下烤面包机拨杆）上的 rollout。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Veo 3.1 在 composed extension 上的 rollout。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/veo-composed_hu_7d4c998cb967f1eb.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/veo-composed_hu_26253ec300332ff3.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/veo-composed_hu_2f68b126212c27e.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/veo-composed_hu_7d4c998cb967f1eb.webp"
width="760"
height="150"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 6：Veo 3.1 在 composed extension（按下拨杆后拿起橙子）上的 rollout。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;&lt;img alt="完整 composed-extension 序列的动画 rollout。"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/veo-composed.gif"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 7：完整 composed-extension 序列的动画 rollout：按下拨杆后拿起橙子。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;对于一个没有被显式训练成机器人策略的模型来说，这个生成 rollout 出乎意料地好。生成动作很平滑，背景保持稳定一致，机器人朝两个目标物体的轨迹也合理。甚至顺序也被遵守了：先完成拨杆，再移动到橙子。&lt;/p&gt;
&lt;p&gt;局限同样明显：模型并没有完全把烤面包机拨杆按下去，有些时刻甚至像是在做相反动作，也就是往上拉。更明显的是，原始 DROID 设置里的夹爪变形成了四指手。固定基座机械臂几乎在上下文帧之后立刻被重新想象成了另一种自由度更少的机器人。&lt;/p&gt;
&lt;p&gt;这些 artifact 符合这样一种解释：模型在使用广泛视觉先验，而不是忠实建模具体硬件。&lt;/p&gt;
&lt;p&gt;即便如此，这个结果仍然说明了为什么视频 backbone 对机器人有吸引力：模型已经有了“机器人-物体交互应该长什么样”的有用先验，虽然它还远远不够可靠，不能直接用于控制。WAM 微调要做的，就是把这种 zero-shot imagination 转成可靠控制。&lt;/p&gt;
&lt;h2 id="理解现代-wam核心形式"&gt;理解现代 WAM：核心形式&lt;/h2&gt;
&lt;p&gt;建立核心动机之后，我们可以聚焦当前的 WAM 研究。与 VLM-based VLA 不同，后者的训练 recipe 已经大致收敛到“VLM co-training + flow transformer 动作生成”，WAM 仍然分裂成几种活跃形式。这也正是这个领域现在有趣的地方：大家还不知道哪一组设计选择会胜出，或者最好的系统是否会合并多个方向。&lt;/p&gt;
&lt;p&gt;为了让设计空间更可读，我把 WAM 按三个轴来组织，虽然这三个轴并不完全独立：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;范式：&lt;/strong&gt; 模型预测什么？预测视频又如何用于生成动作？包括 inverse dynamics、joint prediction、representation-only。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;动作如何进入模型：&lt;/strong&gt; default action tokens、action-as-image、latent actions/plans。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;架构：&lt;/strong&gt; 组件如何组合？Mixture-of-Transformers、monolithic、hierarchical。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这些轴并不完全独立，有些 WAM 也很难干净地归入单一类别。我不会把它当成完美 taxonomy；它更像是一张实用地图，让我们读当前论文时不至于迷失在命名里。对每个轴，我都会先用一篇更早的论文介绍想法，再给出现代放大版。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="WAM 设计空间总览。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/wam-design-space_hu_ada4b7a7827bfbf7.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/wam-design-space_hu_e636790f4ff00b20.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/wam-design-space_hu_ec208a58afa2b0b4.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/wam-design-space_hu_ada4b7a7827bfbf7.webp"
width="760"
height="307"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 8：WAM 设计空间总览。左：三种范式的差异在于模型预测什么。逆动力学 WAM 生成未来视频，再由此推导动作；联合预测 WAM 同时输出视频和动作；表征型 WAM 只把视频 backbone 当表征使用，并在推理时跳过视频生成。中：三种动作集成选择的差异在于动作如何进入模型。动作可以是独立 token，可以是视频模型天然去噪的 image-shaped target，也可以是压缩 latent actions/plans。右：三种架构风格的差异在于组件如何组合。Monolithic transformer 用一个 stack 处理所有内容；共享 attention 连接的模态专家保留独立权重但交换信息；hierarchical pipeline 先运行视频模块再运行动作模块。&lt;/em&gt;&lt;/p&gt;
&lt;h3 id="范式模型预测什么"&gt;范式：模型预测什么？&lt;/h3&gt;
&lt;p&gt;第一个轴是策略形式：模型预测什么，以及预测视频如何用于生成动作。在现代 WAM 中，我们看到三种方向，它们在推理边界上不同：inverse dynamics、joint prediction 和 representation-only。&lt;/p&gt;
&lt;h4 id="逆动力学先预测未来再推断动作"&gt;逆动力学：先预测未来，再推断动作&lt;/h4&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="逆动力学 WAM 抽象图。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/inverse-dynamics-wam_hu_8c78cc84be0550a.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/inverse-dynamics-wam_hu_814f0a3c43d87bfa.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/inverse-dynamics-wam_hu_b2a82db6fdecedce.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/inverse-dynamics-wam_hu_8c78cc84be0550a.webp"
width="760"
height="435"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 9：逆动力学 WAM。视频模型先根据语言指令和当前观测生成未来帧或 latent，然后 inverse-dynamics head 把预测转变映射成动作序列。具体系统会不同：LingBot-VA 和 DVA 使用完整 RGB future，VPP 和 mimic-video 使用 latent video features，也有系统只用中间特征。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;逆动力学设置是最容易理解的 WAM recipe：先想象未来，再从视频中预测最可能的动作。它把困难的语言 grounding 问题转移到视频阶段：把命令翻译成合理的视觉变化。这个方向的押注是，视频预训练已经学到一部分有用的语言到视觉变化映射，因此动作头不必从机器人 demo 中学习所有东西，可以专注于 inverse-dynamics 问题。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="UniPi 总览。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/unipi-overview_hu_5d8ffbca3424a5c7.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/unipi-overview_hu_73b7dabe7626c1b0.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/unipi-overview_hu_f37a9d73f1c8db68.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/unipi-overview_hu_5d8ffbca3424a5c7.webp"
width="760"
height="548"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 10：UniPi 总览。文本条件视频生成器根据当前帧和语言指令生成未来图像序列，单独的 inverse-dynamics 模块再从连续帧中提取动作。图片来自 Du et al., 2023 &lt;a href="#source-10"&gt;[10]&lt;/a&gt;。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;UniPi &lt;a href="#source-10"&gt;[10]&lt;/a&gt; 是这个方向的开创性论文。它可能是第一篇清晰意识到视频 diffusion 对机器人潜力的现代 recipe：把视频当作高层计划，再用逆动力学恢复低层控制。事后看，很多最近的 WAM 工作都像是它的改进版。&lt;/p&gt;
&lt;p&gt;UniPi 也解释了为什么 WAM 还需要几年才进入主流。它使用的是 Imagen Video 时代基于 CNN 的视频 diffusion stack，并且视频生成器必须从头预训练。根据原文脚注中的粗略估计，这种预训练大约需要 167 ZFLOPs，远超多数机器人实验室预算。&lt;sup id="fnref:1"&gt;&lt;a href="#fn:1" class="footnote-ref" role="doc-noteref"&gt;1&lt;/a&gt;&lt;/sup&gt; 虽然这套 recipe 早就存在，但当时对普通实验室并不真正可复现。现代 inverse-dynamics WAM 可以从开放的 DiT-based 视频 backbone 出发再微调，从而绕过这一步。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="LingBot-VA 架构。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/lingbot-va_hu_911d627b99ff1057.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/lingbot-va_hu_e3f27eb7aa200961.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/lingbot-va_hu_f06012a3a6484a9f.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/lingbot-va_hu_911d627b99ff1057.webp"
width="760"
height="280"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 11：LingBot-VA 架构：基于微调 Wan 2.2-5B backbone 的视频 rollout 条件化逆动力学动作预测。图片来自 Li et al., 2026 &lt;a href="#source-9"&gt;[9]&lt;/a&gt;。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;这个方向的现代版本是 LingBot-VA &lt;a href="#source-9"&gt;[9]&lt;/a&gt;。它通过 16k 小时 cross-embodiment 预训练，把 Wan 2.2-5B 变成机器人视频-动作模型。它与 UniPi 的关键差异不仅是规模。LingBot-VA 是因果模型，并且在长视觉历史上训练，用于闭环 rollout，而不是开放环视频生成。它还使用 Mixture-of-Transformers (MoT) 架构：视频和动作各有独立 expert 与权重，但在每层通过共享 self-attention 耦合。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;设计选择&lt;/th&gt;
&lt;th&gt;UniPi &lt;a href="#source-10"&gt;[10]&lt;/a&gt;&lt;/th&gt;
&lt;th&gt;LingBot-VA &lt;a href="#source-9"&gt;[9]&lt;/a&gt;&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;核心想法&lt;/td&gt;
&lt;td&gt;生成未来视频计划，再用逆动力学恢复动作。&lt;/td&gt;
&lt;td&gt;微调视频 backbone，用于闭环机器人 world-action rollout。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Backbone&lt;/td&gt;
&lt;td&gt;CNN-based video diffusion，也就是 cascaded U-Net，在 Imagen Video 时代从头训练。&lt;/td&gt;
&lt;td&gt;Wan 2.2-5B latent DiT，开放权重。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Latent video VAE&lt;/td&gt;
&lt;td&gt;无；生成低分辨率 RGB future。&lt;/td&gt;
&lt;td&gt;Wan 2.2-5B，16 x 16 空间压缩、4x 时间压缩 &lt;a href="#source-56"&gt;[56]&lt;/a&gt;。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Action expert&lt;/td&gt;
&lt;td&gt;单独 CNN action head。&lt;/td&gt;
&lt;td&gt;通过 joint attention 耦合的 MoT action expert。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Action-video coupling&lt;/td&gt;
&lt;td&gt;单向：先视频，再动作。&lt;/td&gt;
&lt;td&gt;双向：视频条件化动作；生成动作也条件化视频。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;机器人训练规模&lt;/td&gt;
&lt;td&gt;小规模，只依赖 demonstration。&lt;/td&gt;
&lt;td&gt;跨 embodiment 的 16k 小时机器人 world-action 预训练。&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;围绕同一主题还有几个变体。Video Prediction Policy &lt;a href="#source-24"&gt;[24]&lt;/a&gt;、DiT4DiT &lt;a href="#source-37"&gt;[37]&lt;/a&gt; 和 mimic-video &lt;a href="#source-14"&gt;[14]&lt;/a&gt; 不一定需要最终 RGB 视频；它们使用视频模型的中间特征作为动作解码器的 predictive plan。DVA &lt;a href="#source-40"&gt;[40]&lt;/a&gt; 和 LingBot-VA 则更直接依赖生成或预测的未来 rollout。困难在于，大多数论文同时改变了视频 backbone、使用不同数量的大规模预训练、调整不同超参数，并在不同设置上评估。&lt;/p&gt;
&lt;h4 id="联合预测一起学习视频和动作"&gt;联合预测：一起学习视频和动作&lt;/h4&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="联合预测 WAM 抽象图。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/joint-prediction-wam_hu_39aa6f7f0439fd07.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/joint-prediction-wam_hu_77989dcdc7510e0f.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/joint-prediction-wam_hu_f53cac74def10474.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/joint-prediction-wam_hu_39aa6f7f0439fd07.webp"
width="760"
height="255"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 12：联合预测 WAM。单个模型接收语言指令和当前观测，在一次前向中同时输出动作序列和想象的未来状态（帧或 latent），没有单独 inverse-dynamics 模块。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;第二种形式是 joint prediction。模型不先生成未来视频再解码动作，而是同时预测视频和动作。这是 WAM 想法中耦合更强的版本：模型被迫在同一次预测中学习“应该发生什么”和“如何让它发生”。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="GR-1 架构。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/gr1-architecture_hu_5be20597e0f8fbd0.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/gr1-architecture_hu_f17ff4ab36fa4a2c.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/gr1-architecture_hu_ac31803dcb015b56.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/gr1-architecture_hu_5be20597e0f8fbd0.webp"
width="760"
height="422"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 13：GR-1 架构。阶段 1 在视频预测上预训练；阶段 2 在机器人数据上用未来帧和 action chunk 的联合目标微调。图片来自 Wu et al., 2023 &lt;a href="#source-11"&gt;[11]&lt;/a&gt;。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;GR-1 &lt;a href="#source-11"&gt;[11]&lt;/a&gt; 是这个方向的早期基础论文。它先在大规模视频上预训练，再在本地机器人数据集上用视频和动作监督微调。它使用 GPT-2 风格的 transformer policy，用 readout tokens 在互联网视频预测上预训练，然后在机器人数据上用联合 video-action 目标微调。R3M &lt;a href="#source-15"&gt;[15]&lt;/a&gt; 和 Voltron &lt;a href="#source-16"&gt;[16]&lt;/a&gt; 等早期工作已经显示，视频和语言能帮助机器人表征学习，但 GR-1 做了一个简单而重要的转向：它用视频学习更好的策略表征，而不只是更好的图像级视觉表征。&lt;/p&gt;
&lt;p&gt;在当时，CALVIN 结果是有用的仿真证据。在更难的 ABC -&amp;gt; D 划分上，GR-1 表中先前方法的平均序列长度都低于 1.0，而 GR-1 达到 3.06 / 5。这个结果在这里有用，因为它让泛化信号最容易读出来。到 2026 年，这个数字已经过时，但我仍认为它有历史意义：它表明，预测未来视觉状态可以塑造更好的策略表征，而不仅仅是更好的视觉编码器。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="CALVIN ABC-&amp;gt;D 结果。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/gr1-calvin_hu_b0c7bb5a0f93bf05.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/gr1-calvin_hu_de3c18ad0496625c.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/gr1-calvin_hu_d97570effb7f2abf.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/gr1-calvin_hu_b0c7bb5a0f93bf05.webp"
width="760"
height="297"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 14：CALVIN ABC -&amp;gt; D 结果，以五个子任务中平均完成数总结；GR-1 作为历史结果，Xiaomi-Robotics-0 作为当前 SOTA VLA 参考。数值重绘自 Wu et al., 2023 &lt;a href="#source-11"&gt;[11]&lt;/a&gt; 和 Xiaomi Robotics, 2026 &lt;a href="#source-27"&gt;[27]&lt;/a&gt;。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;DreamZero &lt;a href="#source-8"&gt;[8]&lt;/a&gt; 是这个想法的现代放大版。它不是围绕视频预测 head 训练一个较小的 transformer policy，而是从 Wan 2.1-I2V-14B-480P 出发，把视频 diffusion backbone 变成联合 world-action model。模型在一个 monolithic DiT 内同时 denoise 视频和动作 token。它没有单独 inverse-dynamics 模块：动作是同一个 denoising 过程里的另一种生成模态。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="DreamZero 架构。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/dreamzero-architecture_hu_4ea00c6d0b9e9ad9.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/dreamzero-architecture_hu_6494d498d0fe0572.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/dreamzero-architecture_hu_1e114a61b91ce509.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/dreamzero-architecture_hu_4ea00c6d0b9e9ad9.webp"
width="760"
height="425"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 15：DreamZero 架构。一个从 14B Wan 视频 diffusion backbone 初始化的单体 transformer，联合去噪视频 token 和动作 token。图片来自 Ye et al., 2026 &lt;a href="#source-8"&gt;[8]&lt;/a&gt;。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;DreamZero 报告的 RoboArena 分数是 WAM 的一个重要真实世界信号。大多数论文仍然聚焦 LIBERO 等流行 benchmark 和其他仿真 benchmark，而 RoboArena 是少数公开真实世界开放式评估之一，所以值得停下来看看下面这张 snapshot。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="2026 年 4 月 RoboArena leaderboard snapshot。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/roboarena-leaderboard_hu_5eeb2f8b442d4d51.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/roboarena-leaderboard_hu_ab1fbdbd7aac739f.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/roboarena-leaderboard_hu_6cc1a8e562094597.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/roboarena-leaderboard_hu_5eeb2f8b442d4d51.webp"
width="760"
height="644"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 16：2026 年 4 月 RoboArena leaderboard snapshot。Pi-FAST (1592) 高于 Pi-0 (1475)，而 Pi-0.5 (1622) 和 DreamZero (1750) 更进一步。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;在上面的 2026 年 4 月 snapshot 中，DreamZero 达到 1750，而 Pi-0.5 是 1622。这是 WAM 潜力的有意义信号。它不能证明 WAM 是更好的默认选择，但确实是正面信号。特别有趣的是，DreamZero 只在 DROID 上训练，没有额外的大规模 cross-embodiment 机器人训练阶段。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;设计选择&lt;/th&gt;
&lt;th&gt;GR-1 &lt;a href="#source-11"&gt;[11]&lt;/a&gt;&lt;/th&gt;
&lt;th&gt;DreamZero &lt;a href="#source-8"&gt;[8]&lt;/a&gt;&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;核心想法&lt;/td&gt;
&lt;td&gt;把未来帧预测作为辅助目标，同时学习动作。&lt;/td&gt;
&lt;td&gt;在一个视频 diffusion backbone 中联合去噪未来视频和机器人动作。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Backbone&lt;/td&gt;
&lt;td&gt;GPT-2 风格 transformer policy，带 video-prediction readout tokens。&lt;/td&gt;
&lt;td&gt;适配到机器人控制的 Wan 2.1-I2V-14B-480P video diffusion model。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;规模&lt;/td&gt;
&lt;td&gt;约 21M policy 参数；预训练视觉和语言编码器分离保留 &lt;a href="#source-55"&gt;[55]&lt;/a&gt;。&lt;/td&gt;
&lt;td&gt;14B Wan backbone，端到端 action-tuning。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;生成目标&lt;/td&gt;
&lt;td&gt;未来视频和动作的 L2 重建。&lt;/td&gt;
&lt;td&gt;面向 joint future-video 和 action generation 的 flow / denoising。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Latent video VAE&lt;/td&gt;
&lt;td&gt;无；使用预训练 MAE / ViT 视觉特征。&lt;/td&gt;
&lt;td&gt;继承 Wan latent video VAE。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;语言条件&lt;/td&gt;
&lt;td&gt;CLIP。&lt;/td&gt;
&lt;td&gt;从 Wan 继承的 T5-family text encoder。&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;GR-1 展示的是策略级 joint video-action prediction，而 DreamZero 把这个想法与现代视频基础模型和 flow-matching 设置结合起来。核心 joint-prediction 想法与 GR-1 相同，但 DreamZero 改掉了周围几乎所有东西，因此这远不是一个干净对比。&lt;/p&gt;
&lt;p&gt;GR-2 &lt;a href="#source-12"&gt;[12]&lt;/a&gt;、Seer &lt;a href="#source-29"&gt;[29]&lt;/a&gt;、PAD &lt;a href="#source-53"&gt;[53]&lt;/a&gt;、UWM &lt;a href="#source-54"&gt;[54]&lt;/a&gt;、UVA &lt;a href="#source-39"&gt;[39]&lt;/a&gt; 和 DreamVLA &lt;a href="#source-38"&gt;[38]&lt;/a&gt; 都处在更广义的 joint-prediction 浪潮附近。PAD 是另一个早期尝试，把联合未来图像预测和机器人动作生成放进同一个联合去噪过程。UWM 对视频和动作使用独立噪声，以便在联合 transformer 内支持更灵活的推理模式。&lt;/p&gt;
&lt;h4 id="只用表征推理时跳过视频生成"&gt;只用表征：推理时跳过视频生成&lt;/h4&gt;
&lt;p&gt;第三个选项是只把视频 backbone 当表征使用，在推理时完全跳过视频生成。Fast-WAM 是这个想法的好例子。&lt;/p&gt;
&lt;p&gt;Fast-WAM &lt;a href="#source-23"&gt;[23]&lt;/a&gt; 使用与 LingBot-VA 类似的 Wan / MoT 风格设置，并且即便没有 16k 小时大规模机器人预训练，也能在仿真 benchmark 上接近它的表现。此外，测试时跳过视频生成让推理速度快了好几倍。不过，Fast-WAM 是少数支持 representation-only 假设的公开证据之一，而当前仿真证据还不足以真正说服我。但我很乐意被未来工作说服。&lt;/p&gt;
&lt;p&gt;现在大多数 WAM 在推理时仍然保留某种视频生成，而且非常慢。Fast-WAM 这类更快 WAM 未来会成为更大的研究方向。&lt;/p&gt;
&lt;h3 id="动作如何进入模型"&gt;动作如何进入模型？&lt;/h3&gt;
&lt;p&gt;讨论完如何组合视频和动作预测之后，我们转向动作如何在模型内部表示。这个选择很重要，因为预训练 backbone 知道如何 denoise 视觉 token，而不是连续机器人动作，所以这里有真实的模态错配。当前论文里我看到三类变体。&lt;/p&gt;
&lt;h4 id="默认动作-token"&gt;默认动作 token&lt;/h4&gt;
&lt;p&gt;最简单的默认做法是添加动作 token，连续或离散皆可，再加一个 action head，把动作当成视频旁边的另一种模态。UniPi、GR-1、DreamZero、LingBot-VA、VPP、mimic-video 和 Fast-WAM 都用了某种版本。风险是模态错配：action chunk 与 backbone 预训练时见过的视觉 token 不同，因此模型必须在动作微调期间适配它的表征。&lt;/p&gt;
&lt;h4 id="action-as-image"&gt;Action as image&lt;/h4&gt;
&lt;p&gt;另一种选择是把动作变成视频模型已经知道的东西。不要添加新动作 token 或单独 action head，而是把动作编码成同一生成接口内的视觉目标，这样预训练视频表征不会被强行打断。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="GENIMA 把动作转成视觉目标。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/genima-action-image_hu_9b4ab861c3dd2e2e.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/genima-action-image_hu_7e17295d3b3f550e.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/genima-action-image_hu_1ad188144961ef1.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/genima-action-image_hu_9b4ab861c3dd2e2e.webp"
width="760"
height="353"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 17：GENIMA 把动作转成视觉目标：图像模型在 RGB 空间中预测 joint-action target，下游 controller 再把这些 target 映射回机器人命令。图片来自 Shridhar et al., 2024 &lt;a href="#source-31"&gt;[31]&lt;/a&gt;。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;这里最接近的早期祖先是 GENIMA &lt;a href="#source-31"&gt;[31]&lt;/a&gt;。GENIMA 微调 Stable Diffusion，让它在 RGB 图像上画出 joint-action target，然后用 controller 把这些视觉 target 映射成 joint-position actions。有趣的是它的接口选择：动作被表达为生成图像模型能画出来的东西。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Cosmos Policy latent injection。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/cosmos-policy-latent_hu_c2f8f33ff32f8ff2.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/cosmos-policy-latent_hu_fbf00947a62f9127.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/cosmos-policy-latent_hu_98557ece5905150a.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/cosmos-policy-latent_hu_c2f8f33ff32f8ff2.webp"
width="760"
height="307"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 18：Cosmos Policy latent injection：动作、本体感知和值目标被表示成同一视频去噪接口内的合成 latent frames。图片来自 Kim et al., 2026 &lt;a href="#source-13"&gt;[13]&lt;/a&gt;。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;这个方向的现代版本是 Cosmos Policy &lt;a href="#source-13"&gt;[13]&lt;/a&gt;，它把动作当成 synthetic latent video frames。它不是添加单独的 action decoder，而是把动作、本体感知和 value target 编码成视频模型自有 denoising 接口里的 fake frames；推理时，通过对空间维度求平均，把预测出的 action image 解码回动作向量。这个设置让预训练视频 backbone 尽量保持在原生视频 denoising 空间内，同时仍然输出机器人动作。&lt;/p&gt;
&lt;h4 id="latent-actions-and-plans"&gt;Latent actions and plans&lt;/h4&gt;
&lt;p&gt;另一个选项是把行为压缩成 latent plans 或 latent actions，再用它们条件化策略。这个方向有吸引力，因为完整视频预测很贵，而且大多数像素对控制并不真的必要。Latent plans 和 latent actions 不完全相同，但在这里我把它们放在一起讨论：二者都是从轨迹或视频中学到的紧凑行为抽象。主要差别是粒度和监督方式。Plans 通常覆盖多步窗口，并且常常需要成对机器人数据；Genie / LAPA 风格的 latent actions 可以从无标签视频中学习。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Play-LMP 架构。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/play-lmp_hu_8d1212714406af1c.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/play-lmp_hu_b513603334576ec3.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/play-lmp_hu_3cbd4a9d3aee88c5.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/play-lmp_hu_8d1212714406af1c.webp"
width="760"
height="533"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 19：Play-LMP 架构。训练时 recognition network 把轨迹窗口压缩成 latent plans；推理时 proposal network 根据当前观测和目标图像预测 latent plan。图片来自 Lynch et al., 2020 &lt;a href="#source-32"&gt;[32]&lt;/a&gt;。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;Play-LMP &lt;a href="#source-32"&gt;[32]&lt;/a&gt; 在 2019 年开创了这个想法。值得记住的是，这个基本想法比当前基础模型浪潮更早。Play-LMP 早在今天的大型机器人数据集和预训练模型出现之前，就把子任务压缩进一个小 latent space，作为低层策略的中间条件抽象。具体来说，posterior network 把短轨迹窗口压缩成 latent plan，prior 学习从当前观测和目标图像预测这个 latent plan，低层策略再把采样计划解码成动作。&lt;/p&gt;
&lt;p&gt;现代 latent-action 浪潮改变的是规模和数据来源。Genie &lt;a href="#source-19"&gt;[19]&lt;/a&gt; 表明，可以从无标签互联网视频中学习 latent action token，并用它驱动 action-conditioned world model。Genie 本身不会把这些 latent 解码成真实机器人电机命令，所以它不是机器人策略。但它让这个想法变得更可扩展：无需真实机器人动作标签，就能从视频中学习 action-like abstraction。LAPA &lt;a href="#source-33"&gt;[33]&lt;/a&gt; 随后把这种 latent-action pretraining 推向 VLA 风格机器人学习。&lt;/p&gt;
&lt;p&gt;Being-H0.7 &lt;a href="#source-42"&gt;[42]&lt;/a&gt; 是原始 Play-LMP 想法的现代 WAM 版本。它保留 prior/posterior latent-plan 逻辑，但在基础模型规模上实现，并有几个重要变化。它不再是小型 hierarchical latent-plan policy，而是使用更大的 Mixture-of-Transformers backbone。类似 Play-LMP，模型有 posterior branch 和 prior branch。Posterior branch 能访问未来观测，用冻结的 V-JEPA2.1 &lt;a href="#source-64"&gt;[64]&lt;/a&gt; 视觉编码器和 Perceiver resampler 编码，再压缩成 \(K\) 个未来 embedding。Prior branch 使用可学习 latent queries，并从可用上下文中学习匹配那些带未来信息的 latent states。测试时，posterior branch 被移除，因此策略获得的是快速 latent interface，而不是强迫模型重新生成完整视频序列。动作生成部分仍然是 flow-matching action policy。Being-H0.7 在 200,000 小时 egocentric human video 和 15,000 小时 robot demonstrations 上训练。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Being-H0.7 latent world-action 架构。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/being-h07_hu_65154e8bc384e1ec.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/being-h07_hu_c1bf421e94f5dca3.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/being-h07_hu_33b1d96b74b556d.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/being-h07_hu_65154e8bc384e1ec.webp"
width="760"
height="264"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 20：Being-H0.7 latent world-action 架构。Posterior branch 把观测到的行为压缩成 latent tokens，而 prior branch 预测这些 token，以实现快速测试时策略推理。图片来自 BeingBeyond Team, 2026 &lt;a href="#source-42"&gt;[42]&lt;/a&gt;。&lt;/em&gt;&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;设计选择&lt;/th&gt;
&lt;th&gt;Latent Plans / Play-LMP &lt;a href="#source-32"&gt;[32]&lt;/a&gt;&lt;/th&gt;
&lt;th&gt;Being-H0.7 &lt;a href="#source-42"&gt;[42]&lt;/a&gt;&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;核心想法&lt;/td&gt;
&lt;td&gt;把短机器人行为窗口压缩成条件化低层策略的 latent plans。&lt;/td&gt;
&lt;td&gt;从大规模 egocentric video 和机器人 demonstration 中学习 latent world-action model。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;数据来源&lt;/td&gt;
&lt;td&gt;Robot play / demonstration trajectories。&lt;/td&gt;
&lt;td&gt;200k 小时 egocentric human video + 15k 小时 robot demonstrations。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;架构&lt;/td&gt;
&lt;td&gt;Hierarchical latent-plan policy；LSTM low-level decoder。&lt;/td&gt;
&lt;td&gt;用于 latent world-action modeling 的大型 MoT transformer。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Latent variable&lt;/td&gt;
&lt;td&gt;轨迹级 latent plan，prior/posterior 训练。&lt;/td&gt;
&lt;td&gt;相同 prior/posterior 结构，但放大到基础模型规模。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;策略接口&lt;/td&gt;
&lt;td&gt;预测 prior plan；低层策略根据观测和目标执行。&lt;/td&gt;
&lt;td&gt;训练两个 branch；测试时只有 prior branch 通过紧凑 latent interface 运行。&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;关键差别不在 latent variable 本身。Play-LMP 已经有核心 prior/posterior latent-plan 想法。Being-H0.7 展示的是，这个接口如何在现代 WAM/VLA hybrid 里被放大。&lt;/p&gt;
&lt;p&gt;Latent actions 也开始流行，成为 action-conditioned world model 的抽象。一个近期例子是 DreamDojo &lt;a href="#source-44"&gt;[44]&lt;/a&gt;，它从大规模 egocentric human video 中学习连续 latent actions，用于 controllable world model。它与逆动力学的重要区别在监督路径上：inverse-dynamics WAM 通常需要成对视频和动作数据，学习视觉转变如何映射到电机命令；latent-action 方法则试图先从视频本身学到行为抽象，再把这个抽象连接到机器人动作。&lt;/p&gt;
&lt;h3 id="架构hierarchicalmonolithic-还是-mot"&gt;架构：Hierarchical、Monolithic 还是 MoT？&lt;/h3&gt;
&lt;p&gt;第三个轴是架构：组件在结构上如何组合。这基本独立于前两个轴。逆动力学可以是 hierarchical 或 MoT 风格；联合预测可以是 monolithic 或 expert-based；latent-action 方法也可以放在多种 wrapper 内。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Hierarchical 架构。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/hierarchical_hu_2c010409845837fd.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/hierarchical_hu_cc79a3c1e9f63eea.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/hierarchical_hu_372b987c8a350322.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/hierarchical_hu_2c010409845837fd.webp"
width="760"
height="434"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 21：Hierarchical：分开的视觉预测阶段和动作生成阶段，单向连接。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;Hierarchical 是最灵活的设计，因为 action head 完全模块化。它可以从简单 CNN regressor（UniPi）到完整 VLA stack（Pi-0.7 的 BAGEL subgoals + 完整 VLA-based action expert），VPP &lt;a href="#source-24"&gt;[24]&lt;/a&gt; 和 mimic-video &lt;a href="#source-14"&gt;[14]&lt;/a&gt; 则位于中间，传递中间视频模型特征而不是完整 RGB rollout。缺点是视频和动作阶段之间耦合较弱。信息单向流动，因此当视频和动作应该强烈相互影响时，这种风格不太自然。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Monolithic transformer。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/monolithic-transformer_hu_4979109358956e2f.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/monolithic-transformer_hu_74d35efef5ac7b75.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/monolithic-transformer_hu_cb755256333c135d.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/monolithic-transformer_hu_4979109358956e2f.webp"
width="760"
height="522"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 22：Monolithic transformer：单个 transformer 端到端联合 denoise 视频和动作。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;DreamZero &lt;a href="#source-8"&gt;[8]&lt;/a&gt; 这样的 monolithic transformer 把视频和动作 denoising 放在同一个 stack 里，因此两条流之间耦合很强。它也天然适合 Cosmos Policy &lt;a href="#source-13"&gt;[13]&lt;/a&gt; 这样的 action-as-image 设置，因为动作和视频已经处在同一个 latent space。风险是双重优化：同一组模型权重必须同时处理密集视觉 token 和稀疏得多的动作 target。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Mixture-of-Transformers。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/mixture-of-transformers_hu_5de85294b81eda2d.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/mixture-of-transformers_hu_d7ab44ec4a841e6.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/mixture-of-transformers_hu_3463712b32cd52de.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/mixture-of-transformers_hu_5de85294b81eda2d.webp"
width="760"
height="425"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 23：Mixture-of-Transformers：通过共享 attention 耦合的模态专用 experts。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;Mixture-of-Transformers (MoT) 是当前默认，包括现代 VLA（Pi-0、Pi-0.5）以及 LingBot-VA &lt;a href="#source-9"&gt;[9]&lt;/a&gt; 和 Fast-WAM &lt;a href="#source-23"&gt;[23]&lt;/a&gt; 这样的近期 WAM。模态专用参数让表征保持分离，而共享 attention 仍然允许视频和动作交换信息。我的猜测是，MoT 风格设计也会成为 WAM 主导架构，主要因为它在模块化和耦合之间给出了实用折中。&lt;/p&gt;
&lt;h3 id="为什么-wam-现在起飞"&gt;为什么 WAM 现在起飞？&lt;/h3&gt;
&lt;p&gt;我对“为什么 WAM 现在起飞”的简短回答是：想法并不新，但所需工具，例如预训练视频模型，终于跟上了。早期形式（UniPi 的 inverse dynamics、GR-1 的 joint prediction、Play-LMP 的 latent abstraction）有正确想法，但工具有限：backbone 更小、视频数据更弱、没有开放可用的视频基础模型，而且 per-step action head 与现代 action chunk policy 相比不够好。它们的现代对应物（LingBot-VA、DreamZero、Being-H0.7）使用的是几年前不存在的基础设施和大规模机器人数据集。&lt;/p&gt;
&lt;p&gt;第一，视频 backbone 变强了。Wan &lt;a href="#source-21"&gt;[21]&lt;/a&gt; 和 Cosmos &lt;a href="#source-22"&gt;[22]&lt;/a&gt; 这样的 DiT-based 模型取代了更早的 CNN-based stack，拥有更好的时间压缩、flow-matching 目标和经过良好清洗的 web-scale 视频数据。第二，这些 backbone 开始开放。研究者现在可以微调强预训练视频模型，而不是自己承担完整预训练成本。第三，动作侧也跟上了：现代系统用 transformer 或 flow-matching head 预测 action chunks，而不是小型 per-step MLP head。这就是为什么 WAM 现在看起来像一个真实 recipe，而不只是“旧想法换新 branding”。&lt;/p&gt;
&lt;h3 id="wam-对比"&gt;WAM 对比&lt;/h3&gt;
&lt;p&gt;下表按不同设计决策总结了前文覆盖的模型：模型预测什么、动作如何进入、使用什么 backbone、采用什么架构。WAM 空间变化很快，所以这里只是选取部分论文。更广泛的世界模型和 WAM 相关机器人学习论文，可以参考 NTU 的 “World Model for Robot Learning” &lt;a href="#source-57"&gt;[57]&lt;/a&gt; 综述。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th&gt;范式&lt;/th&gt;
&lt;th&gt;动作集成&lt;/th&gt;
&lt;th&gt;Backbone&lt;/th&gt;
&lt;th&gt;架构&lt;/th&gt;
&lt;th&gt;年份&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Play-LMP &lt;a href="#source-32"&gt;[32]&lt;/a&gt;&lt;/td&gt;
&lt;td&gt;早于 WAM&lt;/td&gt;
&lt;td&gt;Latent plan&lt;/td&gt;
&lt;td&gt;Transformer + LSTM，从头训练&lt;/td&gt;
&lt;td&gt;Hierarchical&lt;/td&gt;
&lt;td&gt;2019&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;UniPi &lt;a href="#source-10"&gt;[10]&lt;/a&gt;&lt;/td&gt;
&lt;td&gt;Inverse dynamics&lt;/td&gt;
&lt;td&gt;Default action tokens&lt;/td&gt;
&lt;td&gt;CNN Video Diffusion，1.7B&lt;/td&gt;
&lt;td&gt;Hierarchical&lt;/td&gt;
&lt;td&gt;2023&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GR-1 &lt;a href="#source-11"&gt;[11]&lt;/a&gt;&lt;/td&gt;
&lt;td&gt;Joint prediction&lt;/td&gt;
&lt;td&gt;Default action tokens&lt;/td&gt;
&lt;td&gt;Transformer，从头训练&lt;/td&gt;
&lt;td&gt;Unified Transformer&lt;/td&gt;
&lt;td&gt;2024&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GENIMA &lt;a href="#source-31"&gt;[31]&lt;/a&gt;&lt;/td&gt;
&lt;td&gt;Inverse dynamics&lt;/td&gt;
&lt;td&gt;Action-as-image&lt;/td&gt;
&lt;td&gt;Stable Diffusion / ControlNet&lt;/td&gt;
&lt;td&gt;Hierarchical，image generation + controller&lt;/td&gt;
&lt;td&gt;2024&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Seer &lt;a href="#source-29"&gt;[29]&lt;/a&gt;&lt;/td&gt;
&lt;td&gt;Inverse dynamics&lt;/td&gt;
&lt;td&gt;Default action tokens&lt;/td&gt;
&lt;td&gt;Visual/action tokens 上的 transformer&lt;/td&gt;
&lt;td&gt;Unified Transformer&lt;/td&gt;
&lt;td&gt;2025&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;VPP &lt;a href="#source-24"&gt;[24]&lt;/a&gt;&lt;/td&gt;
&lt;td&gt;Inverse dynamics&lt;/td&gt;
&lt;td&gt;Default action tokens&lt;/td&gt;
&lt;td&gt;Stable Video Diffusion&lt;/td&gt;
&lt;td&gt;Hierarchical&lt;/td&gt;
&lt;td&gt;2025&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;mimic-video &lt;a href="#source-14"&gt;[14]&lt;/a&gt;&lt;/td&gt;
&lt;td&gt;Inverse dynamics&lt;/td&gt;
&lt;td&gt;Default action tokens&lt;/td&gt;
&lt;td&gt;Video Diff，Cosmos&lt;/td&gt;
&lt;td&gt;Hierarchical&lt;/td&gt;
&lt;td&gt;2025&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DreamZero &lt;a href="#source-8"&gt;[8]&lt;/a&gt;&lt;/td&gt;
&lt;td&gt;Joint prediction&lt;/td&gt;
&lt;td&gt;Default action tokens&lt;/td&gt;
&lt;td&gt;Video Diff，Wan 14B&lt;/td&gt;
&lt;td&gt;Monolithic DiT&lt;/td&gt;
&lt;td&gt;2026&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;LingBot-VA &lt;a href="#source-9"&gt;[9]&lt;/a&gt;&lt;/td&gt;
&lt;td&gt;Inverse dynamics&lt;/td&gt;
&lt;td&gt;Default action tokens&lt;/td&gt;
&lt;td&gt;Video Diff，Wan 2.2-5B&lt;/td&gt;
&lt;td&gt;MoT&lt;/td&gt;
&lt;td&gt;2026&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Cosmos Policy &lt;a href="#source-13"&gt;[13]&lt;/a&gt;&lt;/td&gt;
&lt;td&gt;Joint prediction&lt;/td&gt;
&lt;td&gt;Action-as-image&lt;/td&gt;
&lt;td&gt;Video Diff，Cosmos&lt;/td&gt;
&lt;td&gt;Monolithic DiT&lt;/td&gt;
&lt;td&gt;2026&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Being-H0.7 &lt;a href="#source-42"&gt;[42]&lt;/a&gt;&lt;/td&gt;
&lt;td&gt;Joint prediction，latent&lt;/td&gt;
&lt;td&gt;Latent plans / actions&lt;/td&gt;
&lt;td&gt;MoT transformer，从头训练，200k + 15k 小时数据&lt;/td&gt;
&lt;td&gt;MoT&lt;/td&gt;
&lt;td&gt;2026&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Fast-WAM &lt;a href="#source-23"&gt;[23]&lt;/a&gt;&lt;/td&gt;
&lt;td&gt;Representation-only&lt;/td&gt;
&lt;td&gt;Default action tokens&lt;/td&gt;
&lt;td&gt;Video Diff，Wan 5.5B&lt;/td&gt;
&lt;td&gt;MoT&lt;/td&gt;
&lt;td&gt;2026&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="实践考虑"&gt;实践考虑&lt;/h2&gt;
&lt;p&gt;上面我们看到了一些有前景的 WAM 模型和结果。不过，核心问题也不少：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;训练成本高。&lt;/strong&gt; 视频 backbone 处理的 token 比 image-conditioned action policy 多得多，完整视频预训练本身也很贵。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;推理慢。&lt;/strong&gt; 生成或 denoise 未来视频 latent 的策略，比简单 VLA 慢得多。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;内存和系统复杂度高。&lt;/strong&gt; 长视频 token 序列会推高 GPU 内存、通信和数据加载压力。如果没有额外工程工作，想在本地 GPU 上跑 10B+ WAM 模型，祝你好运。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="视频先验的成本"&gt;视频先验的成本&lt;/h3&gt;
&lt;p&gt;强视频先验在某些设置中能减少机器人数据需求 &lt;a href="#source-24"&gt;[24]&lt;/a&gt;, &lt;a href="#source-25"&gt;[25]&lt;/a&gt;, &lt;a href="#source-42"&gt;[42]&lt;/a&gt;，并且使用 Wan &lt;a href="#source-21"&gt;[21]&lt;/a&gt; 这样的现代视频模型时仍能带来强 zero-shot 表现。实践中，这往往是在用计算成本换机器人数据效率。我们可以做一个非常粗略的下界比较。&lt;/p&gt;
&lt;p&gt;不同模型的训练成本非常难比较，但可以根据论文和 GitHub repo 中可用细节做一个粗略 lower-bound estimate。因此原文使用简单的 dense-transformer 下界估计：&lt;sup id="fnref:2"&gt;&lt;a href="#fn:2" class="footnote-ref" role="doc-noteref"&gt;2&lt;/a&gt;&lt;/sup&gt;&lt;/p&gt;
\[
C \approx 6NT
\]&lt;p&gt;其中 \(N\) 是可训练 dense 参数量，\(T\) 是处理的 token 数。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="训练计算量下界估计。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/compute-costs_hu_a2a2bef78942a019.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/compute-costs_hu_c95dae99e3206f09.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/compute-costs_hu_7e4314a321325929.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/compute-costs_hu_a2a2bef78942a019.webp"
width="760"
height="418"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 24：以 ZFLOPs 计的 dense-core training compute 下界估计，使用 log scale。请把它看成粗略跨论文比较，而不是精确预算；数值使用各论文/model card 中报告的参数、样本、token 或 GPU-hours，并在原文脚注中给出推导和 caveat。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;VLM-based VLA 在两个训练阶段都更便宜，因为它们的序列更小：它们编码一张到几张图像加文本，然后预测文本或短动作 token 序列。WAM 则训练去预测一段视频 latent 序列，并额外包含动作 token。视频 token 序列通常比 VLA 序列长约 10 倍。这让同一数据集上的训练比默认 VLA 训练更贵。&lt;/p&gt;
&lt;p&gt;图 24 给出了不同 VLA/WAM 训练成本估计的概览。DreamZero 风格 action tuning 大约是 9 ZFLOPs，与轻量 VLA 训练行相比很大。MolmoAct2 这样的现代 VLA 报告了从 Molmo2-ER 到 DROID checkpoint 的完整成本，约为 9.8 ZFLOP-equivalent。这假设继承了强 Molmo2-ER backbone，且不计算 Qwen3 或 SigLIP2 预训练成本。Summer-22B 则是理解竞争性视频基础模型规模成本的现代公开视频预训练 token/data 参考：22B 参数模型和论文中约 500B token 的训练规模，给出约 66 ZFLOP 视频预训练估计。如果把这个估计缩小到 DreamZero 的 Wan 规模 14B，可以估计训练视频模型加 WAM stage 合计约 51 ZFLOPs。与高效 VLA Foundry recipe 的 6.9 ZFLOPs 相比，大约有 7.4 倍差距。这些数字展示了规模化 WAM 训练的挑战。&lt;/p&gt;
&lt;p&gt;除了总 FLOPs，还有硬件和工程门槛。14B 参数模型配合约 8k-token 的 action-tuning 序列，需要大量 GPU 内存，通常还需要配备高端互联的多节点设置。成功的视频模型训练还依赖稳定的数据过滤、captioning、视频解码、latent 预处理、分布式 I/O 和长序列 DiT 基础设施。&lt;/p&gt;
&lt;p&gt;同一论点也有数据质量版本。DreamZero 认为更强的视频生成会转化为更强策略表现 &lt;a href="#source-8"&gt;[8]&lt;/a&gt;，所以 WAM 不仅吃计算，也吃视频数据质量：过滤、captioning、latent representation 和生成式预训练都会成为策略 recipe 的一部分。VLM-based VLA 没有呈现同样干净的联系。VLM4VLA &lt;a href="#source-49"&gt;[49]&lt;/a&gt; 发现，相比从头训练，VLM 初始化有帮助，但通用 VLM 能力并不能很好预测下游 VLA 表现。对 WAM 来说，视频生成质量是好策略的要求；对 VLA 来说，空间目标比其他视觉能力更重要。&lt;/p&gt;
&lt;p&gt;逐行 caveat 和每个估计背后的推导见原文脚注；这里保留核心对比：&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;对比行&lt;/th&gt;
&lt;th&gt;计算内容&lt;/th&gt;
&lt;th&gt;估计 / 报告 accounting&lt;/th&gt;
&lt;th&gt;主要 caveat&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;VLA Foundry VLA/action stage&lt;/td&gt;
&lt;td&gt;在预训练 Foundry VLM 上的最终 VLA/action training stage。&lt;/td&gt;
&lt;td&gt;约 0.56 ZFLOPs，来自约 1.65B 可训练参数、102.4M 样本和约 549 tokens/sample。&lt;/td&gt;
&lt;td&gt;不包括 LLM 或 VLM 预训练。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Pi-FAST / FAST DROID action tuning&lt;/td&gt;
&lt;td&gt;FAST 风格 VLA action-token policy 的代表性 DROID 微调 run。&lt;/td&gt;
&lt;td&gt;240k-step accounting 约 0.77 ZFLOPs；当前 100k-step OpenPI 配置在同样 token 假设下约 0.32 ZFLOPs。&lt;/td&gt;
&lt;td&gt;对 step count 和 sequence length 敏感；不是论文报告的计算预算。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;VLA Foundry full LLM -&amp;gt; VLM -&amp;gt; VLA recipe&lt;/td&gt;
&lt;td&gt;小型 from-scratch VLA Foundry 路径：语言预训练、VLM 训练、VLA/action 训练。&lt;/td&gt;
&lt;td&gt;约 6.9 ZFLOPs，主要来自 800B-token LLM stage。&lt;/td&gt;
&lt;td&gt;这是 1-2B 开放 recipe，不是 frontier-scale VLA。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DreamZero WAM action tuning&lt;/td&gt;
&lt;td&gt;预训练 Wan-14B 视频 backbone 的下游 WAM 适配。&lt;/td&gt;
&lt;td&gt;100k steps、batch 128、约 8.0-8.4k tokens/sequence 时约 8.6-9.0 ZFLOPs。&lt;/td&gt;
&lt;td&gt;不包括训练 Wan 的成本，也不包括 frozen encoder、VAE、通信和数据 pipeline overhead。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;MolmoAct2 reported VLA stack to DROID&lt;/td&gt;
&lt;td&gt;从 Molmo2-ER 出发的 MolmoAct2-Pretrain、post-training 和 DROID embodiment fine-tune。&lt;/td&gt;
&lt;td&gt;由报告的 5,760 + 2,304 + 1,152 = 9,216 H100-hours 得到约 9.8 ZFLOP-equivalent。&lt;/td&gt;
&lt;td&gt;不包括 Molmo2-4B、Molmo2-ER specialization、OpenFAST tokenizer training 和上游 Qwen3/SigLIP2 预训练。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Illustrative Wan-14B full WAM stack&lt;/td&gt;
&lt;td&gt;Wan-scale 视频预训练 proxy 加 DreamZero 风格 action tuning。&lt;/td&gt;
&lt;td&gt;约 51 ZFLOPs = 14B 参数 Wan 风格视频预训练 proxy over 500B tokens + DreamZero 风格 tuning。&lt;/td&gt;
&lt;td&gt;这不是 Summer-22B + DreamZero；它只是用 Summer 的 token budget 作为 Wan-scale 视频预训练 proxy。&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Summer-22B video pretraining estimate&lt;/td&gt;
&lt;td&gt;从头训练视频模型时报告的约 500B-token 视频预训练数据规模。&lt;/td&gt;
&lt;td&gt;22B 参数模型 over 500B video tokens 得到约 66 ZFLOPs。&lt;/td&gt;
&lt;td&gt;这是透明视频预训练估计，不是论文报告的 FLOP 总量。&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="推理速度"&gt;推理速度&lt;/h3&gt;
&lt;p&gt;总体上，VLM-based VLA 并不总是快，但默认 WAM 如果在测试时生成视频，可能更慢。精确数字取决于硬件、实现、diffusion steps 和 action chunk length，但 Fast-WAM &lt;a href="#source-23"&gt;[23]&lt;/a&gt; 中的代表值提供了有用参考：两种常见 WAM 推理模式，也就是 joint prediction 和带完整视频生成的 inverse dynamics，每个 action chunk 需要 590ms 到 800ms，而 Pi-0.5 约为 190ms。&lt;/p&gt;
&lt;p&gt;这意味着推理时间慢 3-4 倍，对实时控制影响很大。可以加速，例如 DreamZero &lt;a href="#source-8"&gt;[8]&lt;/a&gt; 和 Fast-WAM 的“完全跳过视频生成”思路都展示了可能路径，但如果没有大型 GPU，在本地运行这些模型仍然很困难。&lt;/p&gt;
&lt;h2 id="为什么现代-vla-baseline-仍然重要"&gt;为什么现代 VLA baseline 仍然重要？&lt;/h2&gt;
&lt;p&gt;现代 VLM-based VLA 进步很快，最强 baseline 现在结合了四个想法：离散动作 tokenization、保留 VLM 能力的 co-training、隔离 action head，以及更广泛的数据混合。任何声称视频 backbone 是更好默认选择的主张，都必须击败当前 SOTA recipe。&lt;/p&gt;
&lt;p&gt;VLA 架构已经收敛到一个默认设置：Mixture-of-Transformers recipe。它最初由 Transfusion &lt;a href="#source-30"&gt;[30]&lt;/a&gt; 在视觉中引入，并由 Pi-0 &lt;a href="#source-2"&gt;[2]&lt;/a&gt; 在机器人中推广。真正变化的主要是训练 recipe。早期 flow-based action head 会从离散 next-token VLM 预训练突然切换到连续动作 denoising，造成强烈扰动。更新的 recipe 试图减少这种扰动。&lt;/p&gt;
&lt;p&gt;首先，很多现代 VLA 使用 FAST &lt;a href="#source-3"&gt;[3]&lt;/a&gt; 或 BEAST &lt;a href="#source-34"&gt;[34]&lt;/a&gt; 这样的离散 tokenizer，把动作表示为 VLM 可以学习的一种新语言。这背后的动机是优化张力：VLM 为离散 next-token prediction 和 cross-entropy loss 预训练，而机器人动作存在于连续空间，通常用 flow matching 建模。直接用 flow-matching 目标微调 VLM，会导致预训练语言和视觉能力 catastrophic forgetting &lt;a href="#source-51"&gt;[51]&lt;/a&gt;。使用离散动作 tokenization co-training，并常常结合 flow-matching head 的梯度隔离，可以绕开这个问题。VLM 能更接近自己偏好的离散空间，同时学习 embodied control 所需的有用表征；flow-matching head 则基于这些特征做自己的动作预测。测试时，带单独 action head 的系统可以丢掉慢的 autoregressive action-token prediction 路径，让 action head 完成工作。&lt;/p&gt;
&lt;p&gt;为了直观看到 catastrophic forgetting 问题的影响，我们再看 RoboArena &lt;a href="#source-1"&gt;[1]&lt;/a&gt; snapshot。Pi-FAST 使用与 Pi-0-DROID 相同的 backbone，但没有 flow component，而是用离散 FAST token 生成动作。二者都在 DROID 上微调。Pi-FAST 分数达到 1592，而 Pi-0 只有 1475，差距相当大。这支持了一个观点：离散动作 recipe 相比原始 Pi-0 flow-based 设置，能保留更多有用预训练能力。&lt;/p&gt;
&lt;p&gt;其次，Pi-0.5 风格系统会在 VLM 数据和机器人数据上 co-train，并常常在 VLM 与 flow/action 组件之间隔离梯度，以获得更快、更稳定的收敛 &lt;a href="#source-4"&gt;[4]&lt;/a&gt;, &lt;a href="#source-20"&gt;[20]&lt;/a&gt;。这样，VLM 可以继续练习语言和视觉理解，而动作侧专门适配操作。类似模式也出现在 Pi-0.5、Xiaomi-robotics-0 &lt;a href="#source-27"&gt;[27]&lt;/a&gt; 和 Being-H0.5 &lt;a href="#source-28"&gt;[28]&lt;/a&gt; 等近期 VLA 中。Pi-0.5 在 RoboArena 上明显超过 Pi-FAST 和 Pi-0（1622 vs 1592 vs 1475）。这些结果与训练设计决策对策略表现的重要性一致。&lt;/p&gt;
&lt;p&gt;即便 recipe 有这些改进，VLA 仍然会撞上 grounding wall。语言是一种对行为目标表达不充分的方式。杂乱场景中的文本指令，很少能完全指定相关物体实例或期望物理状态。因此策略可能过拟合到背景物体等伪相关或数据集 bias。Pi-0.7 报告的 language-only prompting 与 goal-image conditioning 差距支持这一点：visual subgoals 改善语言跟随，并让训练收敛更快 &lt;a href="#source-41"&gt;[41]&lt;/a&gt;。DreamZero 在同一 RoboArena snapshot 中的 1750 elo-score，也支持视频/图像目标先验能帮助解决这类问题。&lt;/p&gt;
&lt;p&gt;所以，目前 WAM 和 VLA 没有真正赢家，甚至未来是否会有赢家也值得怀疑。Zhang et al. &lt;a href="#source-25"&gt;[25]&lt;/a&gt; 这样的早期比较，在 matched perturbations 下，在 LIBERO-Plus 和 RoboTwin 2.0-Plus 上评估 LingBot-VA、Cosmos Policy 和 Pi-0.5。结果显示，WAM 即使没有 VLA baseline 使用的更广泛训练数据混合，也能达到强鲁棒性。不过，这个比较局限于仿真环境，没有覆盖真实世界泛化。&lt;/p&gt;
&lt;h2 id="两条表示路线其实会合成一条吗"&gt;两条表示路线其实会合成一条吗？&lt;/h2&gt;
&lt;p&gt;开放问题是，从长期看这两条路是否还会保持区别。一些近期 VLA 已经使用 world-model-style 组件来提升目标跟随，例如 Pi-0.7；许多近期 WAM 也借用了 VLA 的 MoT recipe 来做 action expert。机器人基础模型的未来看起来会是二者混合。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="可能的汇合。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/likely-convergence_hu_91b154e771fc1667.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/likely-convergence_hu_7d1420492cf9b3c1.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/likely-convergence_hu_73359293a8ed55a7.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/likely-convergence_hu_91b154e771fc1667.webp"
width="760"
height="760"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 25：可能的汇合：VLA-style、WAM-style，以及结合两者的第三条通用路径。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;Motus &lt;a href="#source-17"&gt;[17]&lt;/a&gt; 和 BagelVLA &lt;a href="#source-18"&gt;[18]&lt;/a&gt; 等近期工作已经显示了这种方向的早期迹象。与其决定语言或视频哪个应该成为机器人的主要表征，不如训练一个全都能做的模型。图 26 是一个简化版本：understanding/VLM 组件、video-generation 组件和 action expert。每个 tower 有专门权重，同时通过共享 self-attention 交换信息，常常还采用非对称模式，让每个 tower 向其他 tower 暴露不同信息。Dense transformer 或 MoE-style routing 都可以实现类似高层想法。&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Motus-style hybrid setup。"
srcset="https://tuagoale.github.io/learning/world-action-models-zh-cn/motus-hybrid_hu_3ae090d9ee840e34.webp 320w, https://tuagoale.github.io/learning/world-action-models-zh-cn/motus-hybrid_hu_1b661847e8d6e500.webp 480w, https://tuagoale.github.io/learning/world-action-models-zh-cn/motus-hybrid_hu_88443bed7e2d3602.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://tuagoale.github.io/learning/world-action-models-zh-cn/motus-hybrid_hu_3ae090d9ee840e34.webp"
width="760"
height="418"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;&lt;em&gt;图 26：Motus-style hybrid setup：视频建模和动作生成由独立 transformer 处理，同时共享 attention 和文本条件，指向统一 VLA+WAM policy recipe。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;这种 hybrid 的 hierarchical 版本也出现在 Physical Intelligence 最近的 Pi-0.7 &lt;a href="#source-41"&gt;[41]&lt;/a&gt; 中。Pi-0.7 是一个 steerable VLA，它的 action expert 在测试时由基于 BAGEL 的 world model &lt;a href="#source-50"&gt;[50]&lt;/a&gt; 生成的 visual subgoals 条件化。高层策略输出子任务指令，world model 把这些指令转成 subgoal images，action expert 再基于当前观测和 subgoal 执行。&lt;/p&gt;
&lt;p&gt;报告的 ablation 支持 language-following 论点：添加 world-model subgoals 能提升复杂 referential task 上的指令跟随能力，而且据称对一些打破 dataset bias 的任务是必要的，no-subgoal 变体会失败。作者还报告说，subgoal images 显著加快训练，因为动作预测更接近当前帧与目标未来帧之间的 inverse-dynamics 问题。在证据阶梯上，这是一个真实世界信号：visual subgoals 可以在 VLA-style stack 内弥合一部分 language-grounding gap。但这不需要更强主张，即每个强 VLA 都必须有完整视频生成 head。&lt;/p&gt;
&lt;p&gt;Sereact 的 Cortex 2.0 &lt;a href="#source-45"&gt;[45]&lt;/a&gt; 是另一个指向 hybrid 方向的 startup 例子。Cortex 2.0 添加了一个 world model，在视觉 latent space 中生成候选未来轨迹，并根据预期进展、风险和效率打分，再用最高分 rollout 条件化执行。这是工业信号：WAM-style foresight 正在成为部署式操作系统中的 planning layer。&lt;/p&gt;
&lt;p&gt;Being-H0.7 &lt;a href="#source-42"&gt;[42]&lt;/a&gt; 是 foundation-model hybrid 的最佳例子：它是一个基于预训练 VLA Being-H0.5 的 latent-plan-style WAM/VLA，使用 InternVL3.5 作为 understanding expert、Qwen3 作为 action expert，并使用 V-JEPA2.1 &lt;a href="#source-64"&gt;[64]&lt;/a&gt; visual encoders。它把 VLA-style 预训练组件、V-JEPA2.1 &lt;a href="#source-64"&gt;[64]&lt;/a&gt; future-observation embeddings、Play-LMP-style prior/posterior latent interface，以及 flow-matching action policy 组合到一起。&lt;/p&gt;
&lt;p&gt;计算成本是目前“一个模型全都做”系统很少的主要原因。训练强 VLM 已经很贵；再叠加大规模视频建模，成本进一步上升。因此，在短期内区分 VLA-style 和 WAM-style 训练仍然有用，一方面是因为计算限制，另一方面是因为我们仍不知道哪些 ingredient 对机器人最重要。你认为这两条路会真正合并，还是其中一条最终胜出？&lt;/p&gt;
&lt;h3 id="第四条路robotics-first-foundation-models"&gt;第四条路：Robotics-first foundation models&lt;/h3&gt;
&lt;p&gt;第四种可能是 robotics-first foundation model (RFFM)。基本上，这会是一种围绕机器人挑战设计的大型 transformer 架构：embodiment、action、contact-rich interaction 和 embodied memory。这个路径的干净版本，不会简单地从 web VLM 或视频生成器出发，再事后接上动作；它会从预训练一开始就把交互和动作放在中心位置。&lt;/p&gt;
&lt;p&gt;我知道的最干净例子是 Generalist AI 的 GEN-1，它提出了一个在 500k 小时 UMI-style wearable data 上预训练的大型机器人行为模型。这个方向的核心问题是访问权限：除了资金雄厚的 startup 和大公司，几乎没人能获得这种规模的人类或机器人数据。所以在获得更多大规模开放机器人数据之前，这条研究路径对社区来说目前是受阻的。&lt;/p&gt;
&lt;p&gt;另一个正交方向也值得指出：V-JEPA 2 &lt;a href="#source-43"&gt;[43]&lt;/a&gt; 这样的 latent world model。它们直接在预训练 latent space 内从视频中学习 latent dynamics。这些模型承诺比 diffusion-based 视频生成更便宜的 rollout、更快推理和更干净的规划信号。这个方向的早期 WAM，例如 VLA-JEPA &lt;a href="#source-63"&gt;[63]&lt;/a&gt; 或 Being-H0.7 &lt;a href="#source-42"&gt;[42]&lt;/a&gt;，已经报告了有前景的表现。&lt;/p&gt;
&lt;h2 id="结语"&gt;结语&lt;/h2&gt;
&lt;p&gt;WAM 会成为机器人基础模型的核心研究分支。VLA 已经收敛到一套大致共享的 recipe：VLM backbone、带 flow matching 的梯度隔离 action expert、以及在广泛 web 和 robotics 数据混合上的 co-training。WAM 则仍处于探索阶段。论文在视频 backbone、策略形式、训练 recipe 和评估设置上差异很大。对一个年轻领域来说，这种研究多样性是健康的，也有许多新想法正在发表。&lt;/p&gt;
&lt;p&gt;不过，还没有人真正知道什么最好。&lt;/p&gt;
&lt;p&gt;这篇文章的结论可以概括为：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;从指令到运动的缺口仍然存在。&lt;/strong&gt; 即使现代 VLA 有离散动作 tokenization、保留 VLM 能力的 co-training 和广泛数据混合，也没有完全关闭这个缺口。WAM 承诺从视频侧攻击这个问题，但当前结果还没有显示它们已经解决了问题。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;机器人 benchmark 仍然是核心问题。&lt;/strong&gt; 我必须重复上一篇文章中的发现：现代 VLA 和 WAM benchmarking 尚未解决。我们需要更多 RoboLab &lt;a href="#source-62"&gt;[62]&lt;/a&gt; 或 MolmoSpaces &lt;a href="#source-61"&gt;[61]&lt;/a&gt; 这样的 benchmark，让 benchmaxxing 更难，并要求真正的策略泛化才能拿到好分数。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;下一代机器人基础模型很可能是 WAM+VLA hybrid。&lt;/strong&gt; Pi-0.7 的 BAGEL subgoals、Cortex 2.0 的 planning-by-foresight、Being-H0.7 的 latent prior/posterior bridge，以及 Motus / BagelVLA 风格 hybrid，都已经在合并 VLA 和 WAM 思想。从头训练的第一批机器人基础模型也是一个有可能的押注，尤其是当我们能获得更多更好的开放机器人数据后。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这就是我目前对 WAM 所处位置的判断。如果你有不同看法，或者有很强的理由支持其中一条路径，欢迎联系我；我会很乐意听到。&lt;/p&gt;
&lt;h2 id="致谢与引用"&gt;致谢与引用&lt;/h2&gt;
&lt;p&gt;原作者感谢 Alexander Schwarz、Ankit Goyal、Elie Aljalbout、Fabio Ramos、Seonghyeon Ye、Shenyuan Gao、Xuning Yang、Yashraj Narang 和 Yixuan Wang 的反馈与讨论。&lt;/p&gt;
&lt;p&gt;本文保留原文引用编号；以下 Sources 与 BibTeX 来自
。&lt;/p&gt;
&lt;h2 id="sources"&gt;Sources&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;&lt;span id="source-1"&gt;&lt;/span&gt;Atreya, Pranav, et al. &amp;ldquo;RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies.&amp;rdquo; CoRL 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-2"&gt;&lt;/span&gt;Black, Kevin, et al. &amp;ldquo;Pi-0: A Vision-Language-Action Flow Model for General Robot Control.&amp;rdquo; arXiv 2024.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-3"&gt;&lt;/span&gt;Pertsch, Karl, et al. &amp;ldquo;FAST: Efficient Action Tokenization for Vision-Language-Action Models.&amp;rdquo; arXiv 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-4"&gt;&lt;/span&gt;Physical Intelligence, et al. &amp;ldquo;Pi-0.5: A Vision-Language-Action Model with Open-World Generalization.&amp;rdquo; arXiv 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-5"&gt;&lt;/span&gt;Bjorck, Johan, et al. &amp;ldquo;GR00T N1: An Open Foundation Model for Generalist Humanoid Robots.&amp;rdquo; arXiv 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-6"&gt;&lt;/span&gt;Liu, Bo, et al. &amp;ldquo;LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning.&amp;rdquo; NeurIPS 2023.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-7"&gt;&lt;/span&gt;Mees, Oier, et al. &amp;ldquo;CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks.&amp;rdquo; RA-L 2022.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-8"&gt;&lt;/span&gt;Ye, Seonghyeon, et al. &amp;ldquo;World Action Models Are Zero-shot Policies.&amp;rdquo; arXiv 2026.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-9"&gt;&lt;/span&gt;Li, Lin, et al. &amp;ldquo;Causal World Modeling for Robot Control.&amp;rdquo; arXiv 2026.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-10"&gt;&lt;/span&gt;Du, Yilun, et al. &amp;ldquo;Learning Universal Policies via Text-Guided Video Generation.&amp;rdquo; NeurIPS 2023.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-11"&gt;&lt;/span&gt;Wu, Hongtao, et al. &amp;ldquo;Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation.&amp;rdquo; ICLR 2024.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-12"&gt;&lt;/span&gt;Cheang, Chi-Lam, et al. &amp;ldquo;GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation.&amp;rdquo; arXiv 2024.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-13"&gt;&lt;/span&gt;Kim, Moo Jin, et al. &amp;ldquo;Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning.&amp;rdquo; arXiv 2026.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-14"&gt;&lt;/span&gt;Pai, Jonas, et al. &amp;ldquo;mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs.&amp;rdquo; arXiv 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-15"&gt;&lt;/span&gt;Nair, Suraj, et al. &amp;ldquo;R3M: A Universal Visual Representation for Robot Manipulation.&amp;rdquo; arXiv 2022.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-16"&gt;&lt;/span&gt;Karamcheti, Siddharth, et al. &amp;ldquo;Language-Driven Representation Learning for Robotics.&amp;rdquo; arXiv 2023.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-17"&gt;&lt;/span&gt;Bi, Hongzhe, et al. &amp;ldquo;Motus: A Unified Latent Action World Model.&amp;rdquo; arXiv 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-18"&gt;&lt;/span&gt;Hu, Yucheng, et al. &amp;ldquo;BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation.&amp;rdquo; arXiv 2026.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-19"&gt;&lt;/span&gt;Bruce, Jake, et al. &amp;ldquo;Genie: Generative Interactive Environments.&amp;rdquo; ICML 2024.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-20"&gt;&lt;/span&gt;Driess, Danny, et al. &amp;ldquo;Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better.&amp;rdquo; NeurIPS 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-21"&gt;&lt;/span&gt;Wan Team, et al. &amp;ldquo;Wan: Open and Advanced Large-Scale Video Generative Models.&amp;rdquo; arXiv 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-22"&gt;&lt;/span&gt;Agarwal, Niket, et al. &amp;ldquo;Cosmos World Foundation Model Platform for Physical AI.&amp;rdquo; arXiv 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-23"&gt;&lt;/span&gt;Yuan, Tianyuan, et al. &amp;ldquo;Fast-WAM: Do World Action Models Need Test-time Future Imagination?&amp;rdquo; arXiv 2026.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-24"&gt;&lt;/span&gt;Hu, Yucheng, et al. &amp;ldquo;Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations.&amp;rdquo; ICML 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-25"&gt;&lt;/span&gt;Zhang, Zhanguang, et al. &amp;ldquo;Do World Action Models Generalize Better than VLAs? A Robustness Study.&amp;rdquo; arXiv 2026.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-26"&gt;&lt;/span&gt;Schäfer, Lukas, et al. &amp;ldquo;When does predictive inverse dynamics outperform behavior cloning?.&amp;rdquo; arXiv preprint arXiv:2601.21718 (2026).
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-27"&gt;&lt;/span&gt;Cai, Rui, et al. &amp;ldquo;Xiaomi-robotics-0: An open-sourced vision-language-action model with real-time execution.&amp;rdquo; arXiv 2026.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-28"&gt;&lt;/span&gt;Luo, Hao, et al. &amp;ldquo;Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization.&amp;rdquo; arXiv 2026.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-29"&gt;&lt;/span&gt;Tian, Yang, et al. &amp;ldquo;Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation.&amp;rdquo; ICLR 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-30"&gt;&lt;/span&gt;Zhou, Chunting, et al. &amp;ldquo;Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model.&amp;rdquo; ICLR 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-31"&gt;&lt;/span&gt;Shridhar, Mohit, Yat Long Lo, and Stephen James. &amp;ldquo;Generative Image as Action Models.&amp;rdquo; CoRL 2024.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-32"&gt;&lt;/span&gt;Lynch, Corey, et al. &amp;ldquo;Learning Latent Plans from Play.&amp;rdquo; CoRL 2020.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-33"&gt;&lt;/span&gt;Ye, Seonghyeon, et al. &amp;ldquo;Latent Action Pretraining from Videos.&amp;rdquo; ICLR 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-34"&gt;&lt;/span&gt;Zhou, Hongyi, et al. &amp;ldquo;BEAST: Efficient Tokenization of B-Splines Encoded Action Sequences for Imitation Learning.&amp;rdquo; NeurIPS 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-35"&gt;&lt;/span&gt;Chi, Cheng, et al. &amp;ldquo;Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots.&amp;rdquo; RSS 2024.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-36"&gt;&lt;/span&gt;Chi, Cheng, et al. &amp;ldquo;Diffusion Policy: Visuomotor Policy Learning via Action Diffusion.&amp;rdquo; IJRR 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-37"&gt;&lt;/span&gt;Ma, Teli, et al. &amp;ldquo;DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control.&amp;rdquo; arXiv 2026.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-38"&gt;&lt;/span&gt;Zhang, Wenyao, et al. &amp;ldquo;DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge.&amp;rdquo; NeurIPS 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-39"&gt;&lt;/span&gt;Li, Shuang, et al. &amp;ldquo;Unified Video Action Model.&amp;rdquo; arXiv 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-40"&gt;&lt;/span&gt;Rhoda AI Team. &amp;ldquo;Causal Video Models Are Data-Efficient Robot Policy Learners.&amp;rdquo; Rhoda AI Blog, 2026.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-41"&gt;&lt;/span&gt;Physical Intelligence. &amp;ldquo;Pi-0.7: a Steerable Model with Emergent Capabilities.&amp;rdquo; Physical Intelligence Blog/Paper, April 2026.
,
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-42"&gt;&lt;/span&gt;Luo, Hao, et al. &amp;ldquo;Being-H0.7: A Latent World-Action Model from Egocentric Videos.&amp;rdquo; arXiv 2026.
,
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-43"&gt;&lt;/span&gt;Assran, Mido, et al. &amp;ldquo;V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning.&amp;rdquo; arXiv 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-44"&gt;&lt;/span&gt;Gao, Shenyuan, et al. &amp;ldquo;DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos.&amp;rdquo; arXiv 2026.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-45"&gt;&lt;/span&gt;Aida, Adriana, et al. &amp;ldquo;Cortex 2.0: Grounding World Models in Real-World Industrial Deployment.&amp;rdquo; arXiv 2026.
,
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-46"&gt;&lt;/span&gt;Mercat, Jean, et al. &amp;ldquo;VLA Foundry: A Unified Framework for Training Vision-Language-Action Models.&amp;rdquo; arXiv 2026.
,
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-47"&gt;&lt;/span&gt;Ryu, Simo, and Chunghwan Han. &amp;ldquo;Summer-22B: A Systematic Approach to Dataset Engineering and Training at Scale for Video Foundation Model.&amp;rdquo; arXiv 2026.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-48"&gt;&lt;/span&gt;Physical Intelligence. &amp;ldquo;openpi.&amp;rdquo; GitHub repository, 2025-2026.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-49"&gt;&lt;/span&gt;Zhang, Jianke, et al. &amp;ldquo;VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models.&amp;rdquo; arXiv 2026.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-50"&gt;&lt;/span&gt;Deng, Chaorui, et al. &amp;ldquo;Emerging Properties in Unified Multimodal Pretraining.&amp;rdquo; arXiv 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-51"&gt;&lt;/span&gt;Hancock, Asher J., et al. &amp;ldquo;Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting.&amp;rdquo; ICLR 2026.
,
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-52"&gt;&lt;/span&gt;Ho, Jonathan, et al. &amp;ldquo;Imagen Video: High Definition Video Generation with Diffusion Models.&amp;rdquo; arXiv 2022.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-53"&gt;&lt;/span&gt;Wang, Lirui, et al. &amp;ldquo;Prediction with Action: Visual Policy Learning via Joint Denoising Process.&amp;rdquo; arXiv 2024.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-54"&gt;&lt;/span&gt;Wen, Junjie, et al. &amp;ldquo;Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets.&amp;rdquo; arXiv 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-55"&gt;&lt;/span&gt;ByteDance Seed. &amp;ldquo;GR-1.&amp;rdquo; GitHub repository, 2024.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-56"&gt;&lt;/span&gt;Wan-Video Team. &amp;ldquo;Wan2.2.&amp;rdquo; GitHub repository, 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-57"&gt;&lt;/span&gt;Hou, Bohan, et al. &amp;ldquo;World Model for Robot Learning: A Comprehensive Survey.&amp;rdquo; 2026.
,
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-58"&gt;&lt;/span&gt;Fang, Haoquan, et al. &amp;ldquo;MolmoAct2: Action Reasoning Models for Real-World Deployment.&amp;rdquo; arXiv 2026.
,
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-59"&gt;&lt;/span&gt;Clark, Christopher, et al. &amp;ldquo;Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding.&amp;rdquo; arXiv 2026.
,
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-60"&gt;&lt;/span&gt;Reuss, Moritz. &amp;ldquo;State of VLA Research at ICLR 2026.&amp;rdquo; Blog post, October 2025.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-61"&gt;&lt;/span&gt;Kim, Yejin, et al. &amp;ldquo;MolmoSpaces: A Large-Scale Open Ecosystem for Robot Navigation and Manipulation.&amp;rdquo; arXiv 2026.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-62"&gt;&lt;/span&gt;Yang, Xuning, et al. &amp;ldquo;RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies.&amp;rdquo; arXiv 2026.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-63"&gt;&lt;/span&gt;Sun, Jingwen, et al. &amp;ldquo;VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model.&amp;rdquo; arXiv 2026.
&lt;/li&gt;
&lt;li&gt;&lt;span id="source-64"&gt;&lt;/span&gt;Mur-Labadia, Lorenzo, et al. &amp;ldquo;V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning.&amp;rdquo; arXiv 2026.&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id="引用这篇文章"&gt;引用这篇文章&lt;/h2&gt;
&lt;p&gt;如果你需要引用原文，可以使用下面的 BibTeX：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bibtex" data-lang="bibtex"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nc"&gt;@misc&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;reuss2026state-wam&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;title&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Pretrained to Imagine, Fine-Tuned to Act: The Rise of World-Action Models}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;author&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Reuss, Moritz}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;year&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{2026}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;month&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{June}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;organization&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Seattle Robotics Lab (SRL), NVIDIA}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;howpublished&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{\url{https://developer.nvidia.com/blog/pretrained-to-imagine-fine-tuned-to-act-the-rise-of-world-action-models}}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;note&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Blog post}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;div class="footnotes" role="doc-endnotes"&gt;
&lt;hr&gt;
&lt;ol&gt;
&lt;li id="fn:1"&gt;
&lt;p&gt;&lt;strong&gt;UniPi / CNN diffusion 计算细节。&lt;/strong&gt; 估计 UniPi 所用 3D U-Net，也就是继承 Imagen Video base architecture 的模型 FLOPs，需要与 Transformer 的 Chinchilla 公式不同的方法。卷积神经网络会让 kernel 在空间和时间维度滑动并共享权重，因此计算量会随分辨率和帧数剧烈变化。以下数字只是粗略数量级估计。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Forward pass：&lt;/strong&gt; base model 生成 16 帧、分辨率 24 x 40，总计 15,360 像素。考虑 U-Net 架构中的空间下采样后，所有 1.7B 参数实际处理的“有效像素”约为每个视频 4,000。Forward FLOPs 约 \(2 \times 1.7B \times 4,000 \approx 13.6\) TFLOPs / video。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Total training FLOPs：&lt;/strong&gt; 训练运行 2,000,000 steps，global batch size 2,048。考虑前向和反向的标准乘数 3：&lt;/li&gt;
&lt;/ul&gt;
\[
C = 3 \times 13.6\text{ TFLOPs} \times 2048 \times 2,000,000 \approx 1.67 \times 10^{23}\text{ FLOPs}
\]&lt;p&gt;换算直觉上，这是约 167 ZFLOPs。在 936 H100-hours / ZFLOP 的直觉下，约为 156,000 H100-hours；如果使用更低的实测有效吞吐假设，例如约 224 TFLOPS/GPU，则约为 207,000 H100-hours。虽然 UniPi 的 1.7B 参数量远小于 DreamZero 的 14B，但必须从头预训练视频基础模型，可能让早期 WAM-style recipe 对多数机器人实验室来说过于昂贵。近期动量部分来自开放预训练视频模型，例如 Wan，它让研究者可以跳过这个 \(10^{23}\) FLOP 级预训练阶段。&amp;#160;&lt;a href="#fnref:1" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;li id="fn:2"&gt;
&lt;p&gt;&lt;strong&gt;Normalized compute accounting.&lt;/strong&gt; 原文柱状图使用 dense-transformer lower-bound：&lt;/p&gt;
\[
C_\text{train} \approx 6 \times N_\text{train} \times T
\]&lt;p&gt;其中 \(N_\text{train}\) 是可训练 dense 参数量，\(T\) 是处理的 token 数。数值以 ZFLOPs 报告，\(1\text{ ZFLOP}=10^{21}\) FLOPs。H100-hour 直觉使用非稀疏 dense BF16-equivalent H100 峰值吞吐量的约 30% 利用率，得到 \(1\text{ ZFLOP} \approx 936\) H100-hours。&lt;/p&gt;
&lt;p&gt;这个估计不包括 preprocessing、dataloading、optimizer overhead、frozen encoder passes、VAE encoding/decoding、超过简单 \(6NT\) 近似的 attention 项、通信开销以及硬件特定效率。它的目的只是做数量级归一化，不是精确系统审计。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;VLA Foundry LLM pretraining：&lt;/strong&gt; Foundry-LLM checkpoint 的 model card 报告了一个 1.2B non-embedding 参数语言模型，在 800B DCLM-Baseline-1.0 token 上训练。用估计中的 1.23B 参数数，\(C \approx 6 \times 1.23B \times 800B = 5.9\) ZFLOPs，约 5.5k H100-hours。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;VLA Foundry VLM stage：&lt;/strong&gt; Foundry-VLM-1.3B-200M model card 报告 1.3B non-embedding 参数 VLM，在 200M image-caption pairs 上训练，并从 Foundry-LLM-1.2B-800B 初始化 &lt;a href="#source-46"&gt;[46]&lt;/a&gt;。按每个样本一个 256-token multimodal sequence 计算，得到 \(T \approx 200M \times 256 = 51.2B\)，\(C \approx 6 \times 1.32B \times 51.2B = 0.41\) ZFLOPs，约 0.4k H100-hours。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;VLA Foundry VLA/action stage：&lt;/strong&gt; Foundry-VLA-1.7B-full model card 报告一个 1.7B non-embedding 参数 VLA，在 102M 仿真和真实双臂操作样本上训练。使用平均 549-token 序列估计，\(T \approx 102.4M \times 549 = 56.2B\)，\(C \approx 6 \times 1.65B \times 56.2B = 0.56\) ZFLOPs，约 0.5k H100-hours。加上 LLM、VLM、VLA stage，总计约 6.9 ZFLOPs。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Pi-FAST / FAST DROID action tuning：&lt;/strong&gt; 使用早期 240k-step DROID accounting，global batch 256，约 700-token 序列：\(T \approx 240k \times 256 \times 700 = 43B\)，因此 \(C \approx 6 \times 3B \times 43B = 0.77\) ZFLOPs，约 0.7k H100-hours。当前 100k-step OpenPI 配置在同样假设下约 0.32 ZFLOPs。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;MolmoAct2 reported VLA stack to DROID：&lt;/strong&gt; MolmoAct2 &lt;a href="#source-58"&gt;[58]&lt;/a&gt; 报告 MolmoAct2-Pretrain 为 5,760 H100-hours，post-training 为 2,300 H100-hours，DROID fine-tune 为 1,150 H100-hours。合计 9,210 H100-hours，并用 \(1\text{ ZFLOP}\approx936\) H100-hours 转成约 9.8 ZFLOP-equivalent。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;DreamZero WAM action tuning：&lt;/strong&gt; DreamZero &lt;a href="#source-8"&gt;[8]&lt;/a&gt; 报告了 14B Wan2.1-I2V-14B-480P backbone、100K training steps、global batch size 128。根据 frame/action 设置和 Wan-style latent-token 近似，序列长度约 8.0k-8.4k tokens。上界估计使用 8,361 tokens，得到 \(T \approx 100k \times 128 \times 8,361 = 107B\)，\(C \approx 6 \times 14B \times 107B = 9.0\) ZFLOPs，约 8.4k H100-hours；略短的 8.0k-token accounting 给出约 8.6 ZFLOPs。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Summer-22B video pretraining：&lt;/strong&gt; Summer-22B &lt;a href="#source-47"&gt;[47]&lt;/a&gt; 报告 22B 参数视频 diffusion model 从头训练在约 50M clips 上，描述为约 500B video tokens。用 \(C \approx 6 \times 22B \times 500B\) 得到 66 ZFLOPs，约 62k H100-hours。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Illustrative full WAM stack：&lt;/strong&gt; 因为 Wan-14B 预训练计算未报告，原文加入一个透明 proxy，把 Summer-22B-style 视频预训练加 DreamZero-style WAM action tuning：66 + 9.0 = 75.0 ZFLOPs，约 70k H100-hours before extra overhead。这不是报告的 DreamZero total，也不应归因于 Wan。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Wan-14B pretraining：&lt;/strong&gt; Wan &lt;a href="#source-21"&gt;[21]&lt;/a&gt; 报告一个 14B video model 在大型 curated image/video corpus 上训练，但没有披露 token count 或完整训练计算预算。因为 DreamZero 从 Wan2.1 出发，DreamZero action-tuning 数字应理解为下游 WAM adaptation 成本，而不是生成底层视频 backbone 的完整成本。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些都是 dense-core 下界估计，且有几行是重新计算的估计，而不是论文报告的计算预算。它们可以帮助比较不同训练 recipe 的粗略位置，但不应被读成精确 wall-clock cost、cloud cost 或端到端能耗。&amp;#160;&lt;a href="#fnref:2" class="footnote-backref" role="doc-backlink"&gt;&amp;#x21a9;&amp;#xfe0e;&lt;/a&gt;&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;/div&gt;</description></item></channel></rss>