VLA Context Brief
INTERNAL TECH NOTE · 2026
Context Design in Embodied AI

四种 VLA 模型,
四种“上下文”

DM0.5、StellaVLA、Skild S1 与 Generalist AI GEN-1.5 都在扩展模型眼前的一帧, 但它们让模型“回忆”或“参考”的对象并不相同:有的是当前执行历史,有的是另一条成功示范。

execution history structured demo raw video demo physical prompt rolling context

01 · Executive snapshot

先记住这四句话

四者都在做 context-conditioned control,但 context 的来源、表示与用途决定了它们实际解决的是不同问题。

01 / DM0.5Memory

看自己的过去

当前 rollout 的 execution history 融入输入,用于识别任务进度、消除当前状态歧义。

02 / StellaVLAAdaptation

看结构化的成功示范

检索一条 demo,再转换为计划、subgoal、轨迹与 3D motion 等结构化提示。

03 / Skild S1Specification

直接看一段原始视频

raw video demonstration 指定任务;视频本身就是 task specification,而非仅靠语言描述。

04 / GEN-1.5Prompting

把示范与执行放进同一窗口

用短时physical prompt 提供 sensorimotor 例子,并与 rolling observations 共同进入统一 context。

02 · Quick judgment

四条路线,简单说优劣

这不是模型能力总榜,而是只看 context design 后,我对各路线工程价值与长期潜力的判断。

一句话判断

History context 最实用,structured demo 最易落地,raw video demo 上限最高,physical prompt 信息最完整。它们分别用计算、结构设计、数据规模或接口对齐来换取泛化能力。

DM0.5 · History context

最稳的长任务补丁
最大优点
不需要额外成功 demo,直接解决长任务中的“失忆”和进度判断,收益明确。
最大短板
只能帮助模型记住“刚才做了什么”,本身不会告诉模型一个新任务“应该怎么做”。
最适合
任务已经学会,但 rollout 很长、多阶段、仅看当前画面容易产生状态歧义的场景。

StellaVLA · Structured demo

最容易工程化
最大优点
把 demo 压缩成计划、subgoal 和 motion cues,信息密度高、可解释、推理成本也更可控。
最大短板
依赖检索与结构化链路;预处理做错会放大误差,也可能丢掉接触、力度等细节。
最适合
已有高质量示范库,希望较快获得 one-shot adaptation,同时重视稳定性和延迟的产品。

Skild S1 · Raw video demo

上限最高,难度最大
最大优点
视频就是任务语言,接口最自然,也最有机会利用大规模人类视频形成跨语言、跨 embodiment 泛化。
最大短板
视频冗余且有歧义,没有显式 action;对数据规模、长上下文和视觉到动作映射要求最高。
最适合
追求 foundation model 式通用性、拥有大规模预训练数据和算力,而非只优化短期部署效率。

GEN-1.5 · Physical prompt

最完整的 physical ICL
最大优点
demo 中显式包含 action,并与 rolling history 使用统一序列;控制信息最完整,机制最像 GPT few-shot。
最大短板
对 sensor/action space 对齐依赖最强;不同机器人之间迁移更难,context window 还要在 prompt 与 history 间分配。
最适合
同类或可对齐 embodiment 上,需要通过短 sensorimotor 示例快速适配精细动作的场景。
近期落地解决执行记忆选 DM0.5;解决 demo adaptation 选 StellaVLA,二者工程路径最清晰。
长期上限S1 赌大规模 raw video 学出通用任务理解;GEN-1.5 赌统一 sensorimotor sequence 学出 physical ICL。
最关键的一点DM0.5 并不排斥另外三条路线。理想系统可以同时拥有外部 demo 和当前 rollout memory。

03 · Side-by-side

同一套字段,对齐比较

这里的“是否包含 action”只指 context 的表示,不指模型最终是否输出机器人动作。

模型 Context 来源 来自当前 rollout Demo 形式 Context 包含 action 是否 structured Rollout history 主要目标 典型优势
DM0.5 当前 episode 已发生的历史 observations
随执行持续更新
不是外部 demo;是自身 trajectory history 未强调
以历史视觉信息为核心
部分
history slots、采样与视觉 token compression
核心设计 时序记忆、进度识别、状态消歧 不依赖预先成功 demo;适合长时、多阶段闭环任务
StellaVLA 另一条检索到的成功 demonstration
与本次 rollout 分离
稀疏关键帧 / subgoals / task plan / traces / 3D motion 动作等价线索
轨迹与 motion,不一定是原始 action tokens

显式结构化 demo
非主要机制 用单条示范做 test-time task adaptation context 信息密度高、可解释;固定 demo 便于复用与缓存
Skild S1 人类或机器人提供的成功视频示范
demo 是外部任务说明
raw video demonstration 不要求显式 action
主要从像素中的行为推断

保留原始视频表征
非公开重点
当前观测仍用于闭环控制
用视频直接指定新任务,支持 in-context learning 接口自然、跨 embodiment 潜力强;减少人工结构设计
GEN-1.5 短时 sensorimotor demo + 当前 rolling observations 混合
demo 否;rolling history 是
3–12 秒 physical prompt,置于约 30 秒统一窗口
含 action trajectories
序列化统一
不是 Stella 式语义结构化

与 prompt 共用窗口
sequence-level physical prompting / few-shot adaptation 示范与在线执行统一建模;保留细粒度 sensorimotor 信息
注:公开博客对训练与接口披露粒度不同。表中“未强调 / 非公开重点”表示该项未被作为核心公开机制,而非断言模型内部完全不存在。

04 · Context pipeline

四种输入流程,一眼区分

左侧是 context 的准备过程,右侧是与当前 observation 合流后驱动 policy action 的方式。

DM0.5

Execution history

过去 observationssame episode
时空采样 + 压缩historical slots
当前 observationtask progress
Policy action“我做到哪了?”

StellaVLA

Structured demo

检索成功 demoanother episode
plan / subgoal / tracestructured context
+
当前 observationonline state
Policy action“这个任务怎么做?”

Skild S1

Raw video demo

原始视频示范task specification
视频表征no manual structure
+
当前 observationclosed-loop control
Policy action“照这个任务做”

GEN-1.5

Physical prompt + history

sensor + actions3–12s prompt
统一 context windowabout 30s
rolling observationscurrent rollout
Policy actionphysical few-shot

05 · Detailed assessment

详细评价:为什么这样判断

以下评价关注设计取向,而不是仅凭公开演示对模型整体能力排序;不同方案依赖的数据、任务与评测并不相同。

我的判断

DM0.5 是 memory-conditioned policy;另外三个更接近 demo-conditioned policy。前者回答“我刚才做了什么、现在做到哪一步”,后者回答“这个新任务应该怎么做”。

DM0.5

最像长期记忆

本质是给 policy 增加 episodic memory,而不是用 demonstration 在测试时教会一个新任务。

优势
无需检索成功 demo;历史与真实执行天然对齐,适合长时、多阶段任务中的进度判断与状态消歧。
代价
history 会不断变化,context 计算与缓存更复杂;它能告诉模型“做到哪了”,但不会单独提供新任务策略。
评价
如果问题是 long-horizon control 中的失忆,DM0.5 最对症;若问题是 one-shot task adaptation,则不应与后三者直接排名。

StellaVLA

最强结构先验

像一个“demo compiler”:先把成功示范压缩成模型更容易消费的计划、subgoal 和 motion cues。

优势
信息密度高、语义清楚、可解释性强;稀疏固定的 demo context 也更适合复用与 prefix/KV cache。
代价
效果更依赖 demo 检索与结构化质量;预处理可能丢掉细粒度接触、力度和时序信息,也带来额外工程链路。
评价
是结构化与效率优先的务实路线:用更强 inductive bias 换取更低的上下文负担和更稳定的任务解释。

Skild S1

最自然的任务接口

把“演示给我看”本身变成 task specification,尽可能少做人工结构化,让模型从 raw video 理解意图。

优势
人类提供任务最自然;视频容易跨语言、跨机器人来源扩展,也避免手工定义 subgoal 或动作语义。
代价
raw video 冗余大且含歧义,对数据规模、视觉理解与长上下文能力要求最高;像素中的动作还需映射到当前 embodiment。
评价
是最“foundation model 式”的路线:以模型规模和预训练吸收结构设计,潜力大,但也最考验数据覆盖与泛化。

GEN-1.5

最像 physical GPT prompt

把带 action 的 sensorimotor example 与在线 history 统一为一条序列,机制上最接近真正的 physical in-context learning。

优势
action trajectory 提供比纯视频更直接的控制监督;demo 与 rollout 使用同一序列接口,概念简洁且信息保真。
代价
依赖传感器与 action space 的可对齐性;固定 context budget 要在 physical prompt 与 rolling history 之间分配容量。
评价
四者中最像 GPT few-shot prompting 的物理版本;相较 S1 更控制导向,相较 StellaVLA 更少语义压缩、更依赖序列建模。
最不该硬比:DM0.5 vs 其余三者一个补当前 episode 的记忆,另外三个用外部 demo 指定或适配任务。
最直接的对照:StellaVLA vs S1同样从成功 demo 学任务,但一个先结构化,一个保留 raw video。
最混合的方案:GEN-1.5同时吸收 inter-episode physical prompt 与 intra-episode rolling history,横跨两种 context 来源。

06 · Unified lens

两个轴,放进同一张图

横轴回答“context 来自本次执行还是另一条 episode”;纵轴回答“context 保留原始序列还是被压缩为结构化提示”。

轴一 · Intra vs Inter
DM0.5 主要从同一 episode 获取记忆;StellaVLA 与 S1 主要从另一 episode 获取示范;GEN-1.5 横跨两侧。
轴二 · Raw vs Structured
S1 最接近原始视频;GEN-1.5 保留 sensorimotor 序列;StellaVLA 显式结构化;DM0.5 对历史视觉 token 做采样压缩。

07 · Bottom line

最关键的比较:
Structured context 还是 Raw context?

S1 与 GEN-1.5 希望模型通过大规模 pretraining,直接从 raw demonstration 中学出任务结构;StellaVLA 则先用 offline reasoning 把 demo 变成 structured context,再交给 VLA。

S1 / GEN-1.5 · Raw context

优势:更 end-to-end、保留信息更多,数据与算力足够时可能有更高上限。
代价:依赖大规模、多样化 pretraining,让模型自己学会 intent 与 motion correspondence。

StellaVLA · Structured context

优势:信息更紧凑、可解释、容易缓存;在 robot data 和算力有限时更现实。
代价:结构化可能丢失动作细节,也会继承 offline extractor 的错误。

简单结论:frontier-scale data / compute 更适合探索 S1、GEN-1.5 的 raw-context 路线;资源和部署约束更现实,StellaVLA 的 structured-context 路线更有吸引力。DM0.5 解决的是 rollout memory,可以与这两类方案组合。