外观
Wan2.2-TI2V-5B 后训交互/可控视频世界模型对照
迁自 2026-09-19 核验稿。配套卡片:Astronex · Zing · ABot · Matrix 3.5 · Yume · DreamX · SolarWM。
面向工程研究读者的对照表。收录标准:明确声明以 Wan2.2-TI2V-5B(或同款 Wan 5B TI2V 先验)为基座后训练的交互/可控视频世界模型。字段均尽量核验 arXiv PDF / HF / GitHub;缺项写「未公开」,禁止编造 GPU hours。
核验范围说明
| 候选 | 是否纳入 | 依据 |
|---|---|---|
| Astronex-World 1.0 (2609.20034) | ✅ | 全文/HF:Wan2.2-TI2V-5B |
| Zing-0.5 (2609.17909) | ✅ | 全文:built on Wan2.2-TI2V-5B |
| ABot-World-0 (2607.19191) | ✅ | 全文:pretrained Wan2.2 backbone;HF 5B + Wan2.2 VAE/T5;同款 5B 后训 |
| Matrix-Game 3.5 (2608.29910) | ✅ | 全文/GitHub:upon Wan2.2-TI2V-5B |
| Matrix-Game 3.0 (2604.08995) | ✅(附录/对照行) | 全文:base upon Wan2.2-TI2V-5B;3.5 的直接前代 |
| Yume-1.5 (2512.22096 / CVPR 2026) | ✅ | 全文脚注指向 Wan-AI/Wan2.2-TI2V-5B |
| DreamX-World 1.0 / 5B (2606.16993) | ✅(增补) | 全文/HF:initialized from Wan2.2-TI2V-5B |
| SolarWM-wan2.2-5B (2609.02886) | ✅(增补) | 全文/HF:Wan2.2 TI2V-5B 族 |
| Boundless-World-Model 等机器人动作 WM | ❌ 主表剔除 | 同先验后训,但任务为机械臂/操作仿真,非开放探索式交互 WM;见文末边界 |
1. 主对照表
| 模型 | 基座先验 | 训练数据(域/规模) | 训练硬件 | GPU hours / 可推算量 | Stage 关键词 | 控制形态 | 推理形态(因果/步数/分辨率/FPS) | 开源与许可 | WBench | 其他评测 | 与同先验基线对比(原文要点) |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Astronex-World 1.0 | Wan2.2-TI2V-5B(5.35B) | Control2V/minWM-data(相机);DROID(动作);IV/V:Control2V + CrossFPS + DrivingDojo + NVIDIA PhysicalAI。clips/小时数:未公开 | 全部 5 stage:2× NVIDIA L20 48GB(FSDP, bf16) | 总 GPU hours:未公开。仅公开 checkpoint/更新步:I 多段至 restore-2200;III≈20 updates;IV≈540 updates(SFT960→1500);V→DMD1545。无卡数×墙钟时间 → 不可推算 | I 双向控制适配(PRoPE+64D action)→ II block-causal teacher forcing → III online UniPC 轨迹蒸馏(25→12)→ IV mixed-domain causal SFT + rolling forcing → V asymmetric DMD/DMD2 + motion | 相机(PRoPE)/ 64-D 连续动作+32 embodiment / 中途文本事件;预留 action-output 头 | 双向 + 因果;因果默认 8-step UniPC,CFG 3.0,8 latent/block,window20+sink4;832×480@24fps(同权 1280×704);宣称单卡 L20 实时 | 权重+代码开源;Apache-2.0(HF) | 团队自述:Navi158 73.5;Full289 70.0(Qual 78.3 / Set 73.8 / Inter 47.6 / Cons 82.4 / Phys 68.1) | 部分 VBench 1.0(未跑完) | 同表:高于同先验 Yume 1.5(68.9 Full);Full 上高于 13.6B LongCat、14B Helios,接近 22B LTX-2.3 |
| Zing-0.5 | Wan2.2-TI2V-5B | 游戏/真实/图文视频;量级感知键盘标注;多 prompt 事件段;30s 长上下文 clips。精确小时/clips:未公开 | 训练 GPU:未公开。推理侧:8× RTX 5090 各 1 流 | 未公开 | 四阶段:双向适配 → 段级多 prompt teacher + block级 causal 双分支 → teacher ODE + local consistency → DMD + Data-Forcing Distillation (DFD)(含 rollout/replay) | 量级感知键盘 W/A/S/D/I/J/K/L + 在线文本事件(同会话不重启) | 因果;4-step;832×480 / 评测用 1248×704;24 FPS(8×5090 各一流;稳态约 24.63);约 $0.009/stream-min | 权重+推理+Zing-SGLang;Apache-2.0 | 团队自述 Navi158:81.0(Qual 80.6 / Set 77.8 / Inter 84.2 / Cons 88.5 / Phys 73.8);对照官方榜 2026-09-09 快照 | 联合控制定性 demo | 5B 上 Navi 与 JoyAI-Echo-1.5 4-step 并列 81.0;强调 playability(导航+文本事件同会话) |
| ABot-World-0 | Wan2.2 backbone(HF:ABot-World-0-5B-LF,Wan2.2 VAE/T5;同款 5B 后训) | AAA 游戏 + UE/3DGS 仿真 + 互联网视频;WorldExplorer 闭环采集。已开源 500h 动作标注集(约 30,969 episodes);论文未给训练总 clips | 训练 GPU:未公开。部署:1× RTX 5090 | 未公开 | 双向 teacher(action 注入+全参微调)→ causal:Teacher Forcing → ODE distillation → LongForcing(长 self-rollout 分布匹配) | 原始键盘;第三人称 reference-character memory;文本条件 | 因果 few-step chunk streaming;720P(1280×704)最高约 16 FPS;action→首帧延迟 1.2s;峰值 VRAM ≈19 GiB(低比特优化包络) | 因果学生权重+推理+Gradio;Apache-2.0;500h 数据已发 | 未报 WBench | WorldRoamBench(Strict Acc 0.5266 等,见表);60s/小时级/日级 rollout 定性 | 相对 Genie3 / HappyOyster / LingBot / HY-World 等在 WorldRoam 分项竞争;非同先验 5B 横比句为主 |
| Matrix-Game 3.5 | Wan2.2-TI2V-5B | UE 仿真 + 开放世界游戏 + 互联网视频(统一几何/质量过滤);规模相对 3.0:未在 3.5 文中重报具体 M clips | 训练卡数/型号:未公开(BF16 + DeepSpeed ZeRO-2)。推理:单卡 H100 可达约 20 FPS@720p | 未公开。仅公开蒸馏步数:Perceptual causal 10,000 steps;Self-Rollout DMD 1,000 outer steps(5:1 fake:student)。无 GPU×步数墙钟 → 不可推算 hours | Base:相机+Patch Memory+tiled PRoPE 联合训 → Distill:Perceptual Flow Matching(teacher-forced)→ curriculum Self-Rollout DMD | 相机(内外参/PRoPE);第一人称 / 第三人称(0–4 主角参考图);文本 | 双向 base + 3-step 因果蒸馏;1280×704 / 720p;单卡最高约 20 FPS(INT8 DiT + MG-LightVAE 等) | Base+Distilled 权重与代码;GitHub Apache-2.0 | 论文未报 WBench | SANA-WM one-minute bench(Simple/Hard):3.5 在单卡 720p 上综合强于 3.0(如 Hard overall 80.85 vs 3.0 的 78.79 等,见表) | 明确相对 Matrix-Game 3.0(同 5B Wan):几何记忆与蒸馏后的长程/单卡吞吐提升 |
| Matrix-Game 3.0(前代) | Wan2.2-TI2V-5B | UE5 + AAA + 真实;约 4.8M video clips(论文) | 训练 GPU hours:未公开。推理:约 8 DiT + 1 VAE GPU → 最高 40 FPS@720p | 未公开 | 动作/自校正 base + camera-aware memory + multi-segment DMD/Self-Forcing 对齐蒸馏 + 量化剪枝 | 动作/相机;记忆检索 | 5B;720p;最高约 40 FPS(多卡异步) | 开源(Skywork/Matrix-Game 系);许可以仓库为准 | 部分第三方榜可见 MatrixGame3≈71.3 量级(非本文核验重点) | 长程记忆与实时 720p 自建/对比实验 | 3.5 的直接同先验前代基线 |
| Yume-1.5 | Wan2.2-TI2V-5B(文中 Wan2.2-5B,脚注 HF TI2V-5B) | Real(Sekai 子集→键盘/鼠标)+ Synthetic(OpenVid 等 720p)+ Event(约 1 万 I2V 合成事件);精确总小时:未公开 | NVIDIA A100(卡数未公开);batch 40,lr 1e-5;foundation 10,000 iters → Self-Forcing+TSCM 600 iters | 未公开(缺卡数与墙钟;不可用「iters×未知卡」硬推 hours) | Foundation(交替 T2V/I2V)→ Self-Forcing + TSCM(上下文压缩+线性注意力蒸馏) | 键盘/鼠标探索 + 文本世界事件 | 因果流式;评测 4 steps;宣称 单卡 A100 约 12 fps@540p;训练分辨率 704×1280@16fps | 代码+5B/14B 权重;Apache-2.0 | Astronex 对照表转引 Full:68.9(†同 Wan 先验;非 Yume 原文主表,属团队转引) | Yume-Bench(instruction-following 0.836 等) | 相对早期 Yume/Wan-2.1/MatrixGame:指令跟随显著提升 |
| DreamX-World 1.0(5B) | Wan2.2-TI2V-5B | UE 精确相机 + 游戏动作 + 真实恢复几何;规模:未公开具体小时 | 训练 GPU:未公开。延迟对比用 8×H20;部署宣称 8×RTX 5090 异步最高 16 FPS | 未公开 | 相机 E-PRoPE → Memory-Conditioned Scene Persistence → Event Instruction Tuning → Causal forcing + DMD + long-rollout → RL(DiffusionNFT) 后蒸馏 | 键盘式相机 WASD+IJKL;可组合文本事件;几何记忆检索 | 因果 chunk+KV;约 704×1280@16fps;最长约 1 min;few-step | HF+GitHub;MIT | 文中讨论 WBench 设定,未给官方 Navi/Full 数字 | 自建 5s basic(overall 84.76,camera 73.75)、30s long-horizon、memory consistency、人偏 | 相对 HY-WorldPlay 1.5 / LingBot 等;同先验 5B 横比句有限 |
| SolarWM-wan2.2-5B | Wan2.2 TI2V-5B(族内 wan2.2-5B) | Solar Open Data:约 1.43M canonical clips / 25.85TB,10 源数据集(含 ABOT、DL3DV、SpatialVID 等) | 训练 GPU/hours:未公开 | 未公开 | 统一三阶段:双向 PRoPE 适配 → Teacher-Forced AnyFlow → DMD/SGF 少步因果(强调省去额外 Causal ODE/CD) | 相机(统一 metric 几何合同) | 因果;文中 fast 学生 4-step@16fps,输入约 1248×704 / 输出 1280×720;宣传分钟~小时级 rollout(仅在 5s 序列上训练) | 数据引擎+配方+多 backbone 权重;代码 Apache-2.0;权重许可见各 release 目录 | 未公开 WBench 分数 | 自建 in/OOD、分钟/小时级定性与一致性 | 同配方可扩到 14B/22B/33B;5B 路线为可复现底座 |
2. 各模型 Stage 简表(附录)
Astronex-World 1.0(5 stages,均 2×L20)
| Stage | 目标 | 方法关键词 | 数据要点 |
|---|---|---|---|
| I Bidirectional control | 加相机+64D 动作 | 全时序注意力 + flow matching;PRoPE;LoRA | Control2V;DROID |
| II Block-causal | 结构改因果 | teacher forcing;block-causal mask | Control2V |
| III Online UniPC traj. | 降采样步 | CF++:25-step teacher → 12-step student | Control2V |
| IV Mixed causal SFT | 恢复动态/跨域 | window 20 + sink 4;rolling forcing | Control2V+CrossFPS+DrivingDojo+PhysicalAI |
| V Asymmetric DMD | 少步分布匹配 | causal self-rollout;双向 real-score;motion term | 同 IV → release DMD1545 |
Zing-0.5(4 stages)
| Stage | 目标 | 方法关键词 |
|---|---|---|
| 1 Bidirectional adaptation | 键盘+文本先验适配 | 保留双向;混入无动作 T2I/T2V/I2V |
| 2 Autoregressive dual-branch | 事件尺度监督 | 段级双向多 prompt teacher + 块级 causal student |
| 3 Consistency mid-training | 少步初始化 | teacher ODE + local consistency(类 CF++) |
| 4 DMD (+DFD) | 实时 4-step | Decoupled DMD、Data-Forcing、rollout/replay |
ABot-World-0
| Phase | Stage | 目标 | 方法关键词 |
|---|---|---|---|
| Teacher | Action injection | 动作可控双向模型 | 全参微调 Wan2.2;键盘动作;参考角色记忆 |
| Student 1 | Teacher Forcing | 改因果 | clean history + causal mask |
| Student 2 | ODE Distillation | 少步 | 冻结 Stage1 PF-ODE 端点回归 |
| Student 3 | LongForcing | 抑长程漂移 | 长 self-rollout ↔ 扩展视野双向 teacher 分布匹配 |
Matrix-Game 3.5
| Stage | 目标 | 方法关键词 |
|---|---|---|
| Base | 几何一致长程 | Patch Memory(无额外可学参)+ tiled PRoPE;静/动态解耦 |
| Distill-1 | 少步因果初始化 | Perceptual Flow Matching(InternVideo2 特征)+ teacher-forced chunks |
| Distill-2 | 推理对齐 | curriculum Self-Rollout DMD(先无 memory 再逐步打开)→ 3-step |
Matrix-Game 3.0(前代摘要)
| 模块 | 关键词 |
|---|---|
| Base | 动作条件 + error buffer 自校正 + camera-aware memory |
| Distill | multi-segment DMD / Self-Forcing 对齐 |
| Deploy | INT8 DiT、VAE prune、GPU 检索 → 最高约 40 FPS@720p(多卡) |
Yume-1.5
| Stage | 目标 | 方法关键词 |
|---|---|---|
| Foundation | 键盘世界探索+事件 | 混合 Real/Synthetic/Event;交替 T2V/I2V;704×1280 |
| Acceleration | 实时流式 | TSCM 上下文压缩 + Self-Forcing 双向注意力蒸馏;4-step 推理 |
DreamX-World 1.0
| Stage | 关键词 |
|---|---|
| Camera | E-PRoPE(降空间 token 的投影式相机条件) |
| Memory | Camera-geometry retrieval + residual recycling / error injection |
| Event | Event Instruction Tuning(可组合多实体事件) |
| AR+DMD | Causal forcing + DMD + long student rollout |
| Post | RL / DiffusionNFT 恢复相机跟随与画质 |
SolarWM-wan2.2-5B
| Stage | 关键词 |
|---|---|
| 0.5 / Bidirectional | PRoPE 相机;5s TI2V;双向 |
| 1 TF-AnyFlow | Teacher forcing + AnyFlow → 直接少步 AR 初始化(省 ODE/CD) |
| 2 DMD/SGF | Self-rollout 分布匹配;4-step 因果学生 |
3. 「怎么读」选型洞察(工程向)
- 同先验 ≠ 同算力画像:Astronex 明确全流程仅 2×L20;Yume 报 A100 但缺卡数;ABot/Zing/Matrix/DreamX/Solar 训练 GPU hours 均未公开。选型时把「可复现训练预算」与「可下载推理权重」分开评估。
- 控制接口决定产品形态:键盘原生(Zing/ABot/Yume)利于游戏感;PRoPE/相机轨迹(Astronex/Matrix/Solar/DreamX)利于几何一致漫游与记忆回访;联合键盘+在线文本(Zing、Yume、DreamX 事件、Astronex event)更接近「可玩世界」。
- WBench 不可直接横向硬比:Zing Navi 81.0、Astronex Navi 73.5 / Full 70.0 为团队自述;ABot 主榜是 WorldRoamBench;Matrix 3.5 主榜是 SANA-WM one-minute;DreamX 自建 basic/30s。先对齐 split(Navi vs Full)与是否官方评测代码,再谈分数。
- 实时路径高度同构、细节不同:主流均为「双向 teacher → causal student → DMD/类 DMD」。差异在 LongForcing(ABot)、Patch Memory + Perceptual FM(Matrix 3.5)、AnyFlow 省中间蒸馏(Solar)、RL 后蒸馏(DreamX)、TSCM(Yume)——工程复现优先抄「与目标失败模式匹配」的那一段。
- 开源完整度:要「数据+配方+多 stage ckpt」看 SolarWM;要「桌面单卡 720p 交互」看 ABot;要「Navi 分数+联合文本」看 Zing;要「双形态权重+事件+低卡后训故事」看 Astronex;要「几何记忆+分钟级 720p」看 Matrix 3.5。
4. 诚实边界:GPU hours 与规模未公开清单
| 模型 | GPU hours | 备注 |
|---|---|---|
| Astronex-World 1.0 | 未公开 | 仅知 2×L20 + 若干 updates/checkpoints;无墙钟不可换算 hours |
| Zing-0.5 | 未公开 | 训练卡型/卡数未写;仅推理 8×5090 |
| ABot-World-0 | 未公开 | 仅部署 1×5090;数据 500h 已开源,≠训练 compute |
| Matrix-Game 3.5 | 未公开 | 有 10k+1k 蒸馏步,无卡数/步时 |
| Matrix-Game 3.0 | 未公开 | 有约 4.8M clips,无训练 hours |
| Yume-1.5 | 未公开 | A100 + 10k/600 iters,卡数未知 |
| DreamX-World 1.0 | 未公开 | — |
| SolarWM-wan2.2-5B | 未公开 | 数据规模公开(1.43M clips),compute 未公开 |
其他未公开/需谨慎字段:多数模型的精确「训练小时视频」;Astronex 混合域各源采样比;Zing/DreamX 原始数据体量;ABot 是否严格写明字符串 TI2V-5B(本文按 Wan2.2 5B + HF 资产判定为同款纳入)。
剔除说明:Boundless 等 机器人操作世界模型 虽可能同 Wan 5B 后训,但不纳入本「交互探索视频 WM」主表,避免控制语义混淆。
5. 主要来源(核验日 2026-09-19,Asia/Shanghai)
- Astronex-World 1.0: arXiv:2609.20034;HF
Astronex-Lab/Astronex-World - Zing-0.5: arXiv:2609.17909;HF
seedleap/zing-0.5 - ABot-World-0: arXiv:2607.19191;HF
acvlab/ABot-World-0-5B-LF;数据acvlab/ABot-World-Explorer-500h - Matrix-Game 3.5: arXiv:2608.29910;GitHub
Riemann-Dynamics/Matrix-Game-3.5 - Matrix-Game 3.0: arXiv:2604.08995
- Yume-1.5: arXiv:2512.22096;GitHub
stdstu12/YUME - DreamX-World: arXiv:2606.16993;HF
GD-ML/DreamX-World-5B - SolarWM: arXiv:2609.02886;HF
junchaoh-cs/SolarWM-Wan2.2-5B
原始核验备忘已迁入本页。结构化卡片见 docs/models/ 与 data/models/*.yml。