看自己的过去
把当前 rollout 的 execution history 融入输入,用于识别任务进度、消除当前状态歧义。
DM0.5、StellaVLA、Skild S1 与 Generalist AI GEN-1.5 都在扩展模型眼前的一帧, 但它们让模型“回忆”或“参考”的对象并不相同:有的是当前执行历史,有的是另一条成功示范。
01 · Executive snapshot
四者都在做 context-conditioned control,但 context 的来源、表示与用途决定了它们实际解决的是不同问题。
把当前 rollout 的 execution history 融入输入,用于识别任务进度、消除当前状态歧义。
检索一条 demo,再转换为计划、subgoal、轨迹与 3D motion 等结构化提示。
以raw video demonstration 指定任务;视频本身就是 task specification,而非仅靠语言描述。
用短时physical prompt 提供 sensorimotor 例子,并与 rolling observations 共同进入统一 context。
02 · Quick judgment
这不是模型能力总榜,而是只看 context design 后,我对各路线工程价值与长期潜力的判断。
History context 最实用,structured demo 最易落地,raw video demo 上限最高,physical prompt 信息最完整。它们分别用计算、结构设计、数据规模或接口对齐来换取泛化能力。
03 · Side-by-side
这里的“是否包含 action”只指 context 的表示,不指模型最终是否输出机器人动作。
| 模型 | Context 来源 | 来自当前 rollout | Demo 形式 | Context 包含 action | 是否 structured | Rollout history | 主要目标 | 典型优势 |
|---|---|---|---|---|---|---|---|---|
| DM0.5 | 当前 episode 已发生的历史 observations | 是 随执行持续更新 |
不是外部 demo;是自身 trajectory history | 未强调 以历史视觉信息为核心 |
部分 history slots、采样与视觉 token compression |
核心设计 | 时序记忆、进度识别、状态消歧 | 不依赖预先成功 demo;适合长时、多阶段闭环任务 |
| StellaVLA | 另一条检索到的成功 demonstration | 否 与本次 rollout 分离 |
稀疏关键帧 / subgoals / task plan / traces / 3D motion | 动作等价线索 轨迹与 motion,不一定是原始 action tokens |
是 显式结构化 demo |
非主要机制 | 用单条示范做 test-time task adaptation | context 信息密度高、可解释;固定 demo 便于复用与缓存 |
| Skild S1 | 人类或机器人提供的成功视频示范 | 否 demo 是外部任务说明 |
raw video demonstration | 不要求显式 action 主要从像素中的行为推断 |
否 保留原始视频表征 |
非公开重点 当前观测仍用于闭环控制 |
用视频直接指定新任务,支持 in-context learning | 接口自然、跨 embodiment 潜力强;减少人工结构设计 |
| GEN-1.5 | 短时 sensorimotor demo + 当前 rolling observations | 混合 demo 否;rolling history 是 |
3–12 秒 physical prompt,置于约 30 秒统一窗口 | 是 含 action trajectories |
序列化统一 不是 Stella 式语义结构化 |
是 与 prompt 共用窗口 |
sequence-level physical prompting / few-shot adaptation | 示范与在线执行统一建模;保留细粒度 sensorimotor 信息 |
04 · Context pipeline
左侧是 context 的准备过程,右侧是与当前 observation 合流后驱动 policy action 的方式。
Execution history
Structured demo
Raw video demo
Physical prompt + history
05 · Detailed assessment
以下评价关注设计取向,而不是仅凭公开演示对模型整体能力排序;不同方案依赖的数据、任务与评测并不相同。
DM0.5 是 memory-conditioned policy;另外三个更接近 demo-conditioned policy。前者回答“我刚才做了什么、现在做到哪一步”,后者回答“这个新任务应该怎么做”。
本质是给 policy 增加 episodic memory,而不是用 demonstration 在测试时教会一个新任务。
像一个“demo compiler”:先把成功示范压缩成模型更容易消费的计划、subgoal 和 motion cues。
把“演示给我看”本身变成 task specification,尽可能少做人工结构化,让模型从 raw video 理解意图。
把带 action 的 sensorimotor example 与在线 history 统一为一条序列,机制上最接近真正的 physical in-context learning。
06 · Unified lens
横轴回答“context 来自本次执行还是另一条 episode”;纵轴回答“context 保留原始序列还是被压缩为结构化提示”。
07 · Bottom line
S1 与 GEN-1.5 希望模型通过大规模 pretraining,直接从 raw demonstration 中学出任务结构;StellaVLA 则先用 offline reasoning 把 demo 变成 structured context,再交给 VLA。
优势:更 end-to-end、保留信息更多,数据与算力足够时可能有更高上限。
代价:依赖大规模、多样化 pretraining,让模型自己学会 intent 与 motion correspondence。
优势:信息更紧凑、可解释、容易缓存;在 robot data 和算力有限时更现实。
代价:结构化可能丢失动作细节,也会继承 offline extractor 的错误。
简单结论:frontier-scale data / compute 更适合探索 S1、GEN-1.5 的 raw-context 路线;资源和部署约束更现实,StellaVLA 的 structured-context 路线更有吸引力。DM0.5 解决的是 rollout memory,可以与这两类方案组合。