Skip to content

Wan2.2-TI2V-5B 后训交互/可控视频世界模型对照

迁自 2026-09-19 核验稿。配套卡片:Astronex · Zing · ABot · Matrix 3.5 · Yume · DreamX · SolarWM

面向工程研究读者的对照表。收录标准:明确声明以 Wan2.2-TI2V-5B(或同款 Wan 5B TI2V 先验)为基座后训练的交互/可控视频世界模型。字段均尽量核验 arXiv PDF / HF / GitHub;缺项写「未公开」,禁止编造 GPU hours

核验范围说明

候选是否纳入依据
Astronex-World 1.0 (2609.20034)全文/HF:Wan2.2-TI2V-5B
Zing-0.5 (2609.17909)全文:built on Wan2.2-TI2V-5B
ABot-World-0 (2607.19191)全文:pretrained Wan2.2 backbone;HF 5B + Wan2.2 VAE/T5;同款 5B 后训
Matrix-Game 3.5 (2608.29910)全文/GitHub:upon Wan2.2-TI2V-5B
Matrix-Game 3.0 (2604.08995)✅(附录/对照行)全文:base upon Wan2.2-TI2V-5B;3.5 的直接前代
Yume-1.5 (2512.22096 / CVPR 2026)全文脚注指向 Wan-AI/Wan2.2-TI2V-5B
DreamX-World 1.0 / 5B (2606.16993)✅(增补)全文/HF:initialized from Wan2.2-TI2V-5B
SolarWM-wan2.2-5B (2609.02886)✅(增补)全文/HF:Wan2.2 TI2V-5B 族
Boundless-World-Model 等机器人动作 WM❌ 主表剔除同先验后训,但任务为机械臂/操作仿真,非开放探索式交互 WM;见文末边界

1. 主对照表

模型基座先验训练数据(域/规模)训练硬件GPU hours / 可推算量Stage 关键词控制形态推理形态(因果/步数/分辨率/FPS)开源与许可WBench其他评测与同先验基线对比(原文要点)
Astronex-World 1.0Wan2.2-TI2V-5B(5.35B)Control2V/minWM-data(相机);DROID(动作);IV/V:Control2V + CrossFPS + DrivingDojo + NVIDIA PhysicalAI。clips/小时数:未公开全部 5 stage:2× NVIDIA L20 48GB(FSDP, bf16)总 GPU hours:未公开。仅公开 checkpoint/更新步:I 多段至 restore-2200;III≈20 updates;IV≈540 updates(SFT960→1500);V→DMD1545。无卡数×墙钟时间 → 不可推算I 双向控制适配(PRoPE+64D action)→ II block-causal teacher forcing → III online UniPC 轨迹蒸馏(25→12)→ IV mixed-domain causal SFT + rolling forcing → V asymmetric DMD/DMD2 + motion相机(PRoPE)/ 64-D 连续动作+32 embodiment / 中途文本事件;预留 action-output 头双向 + 因果;因果默认 8-step UniPC,CFG 3.0,8 latent/block,window20+sink4;832×480@24fps(同权 1280×704);宣称单卡 L20 实时权重+代码开源;Apache-2.0(HF)团队自述:Navi158 73.5;Full289 70.0(Qual 78.3 / Set 73.8 / Inter 47.6 / Cons 82.4 / Phys 68.1)部分 VBench 1.0(未跑完)同表:高于同先验 Yume 1.5(68.9 Full);Full 上高于 13.6B LongCat、14B Helios,接近 22B LTX-2.3
Zing-0.5Wan2.2-TI2V-5B游戏/真实/图文视频;量级感知键盘标注;多 prompt 事件段;30s 长上下文 clips。精确小时/clips:未公开训练 GPU:未公开。推理侧:8× RTX 5090 各 1 流未公开四阶段:双向适配 → 段级多 prompt teacher + block级 causal 双分支 → teacher ODE + local consistency → DMD + Data-Forcing Distillation (DFD)(含 rollout/replay)量级感知键盘 W/A/S/D/I/J/K/L + 在线文本事件(同会话不重启)因果;4-step;832×480 / 评测用 1248×704;24 FPS(8×5090 各一流;稳态约 24.63);约 $0.009/stream-min权重+推理+Zing-SGLang;Apache-2.0团队自述 Navi15881.0(Qual 80.6 / Set 77.8 / Inter 84.2 / Cons 88.5 / Phys 73.8);对照官方榜 2026-09-09 快照联合控制定性 demo5B 上 Navi 与 JoyAI-Echo-1.5 4-step 并列 81.0;强调 playability(导航+文本事件同会话)
ABot-World-0Wan2.2 backbone(HF:ABot-World-0-5B-LF,Wan2.2 VAE/T5;同款 5B 后训AAA 游戏 + UE/3DGS 仿真 + 互联网视频;WorldExplorer 闭环采集。已开源 500h 动作标注集(约 30,969 episodes);论文未给训练总 clips训练 GPU:未公开。部署:1× RTX 5090未公开双向 teacher(action 注入+全参微调)→ causal:Teacher Forcing → ODE distillation → LongForcing(长 self-rollout 分布匹配)原始键盘;第三人称 reference-character memory;文本条件因果 few-step chunk streaming;720P(1280×704)最高约 16 FPS;action→首帧延迟 1.2s;峰值 VRAM ≈19 GiB(低比特优化包络)因果学生权重+推理+Gradio;Apache-2.0;500h 数据已发未报 WBenchWorldRoamBench(Strict Acc 0.5266 等,见表);60s/小时级/日级 rollout 定性相对 Genie3 / HappyOyster / LingBot / HY-World 等在 WorldRoam 分项竞争;非同先验 5B 横比句为主
Matrix-Game 3.5Wan2.2-TI2V-5BUE 仿真 + 开放世界游戏 + 互联网视频(统一几何/质量过滤);规模相对 3.0:未在 3.5 文中重报具体 M clips训练卡数/型号:未公开(BF16 + DeepSpeed ZeRO-2)。推理:单卡 H100 可达约 20 FPS@720p未公开。仅公开蒸馏步数:Perceptual causal 10,000 steps;Self-Rollout DMD 1,000 outer steps(5:1 fake:student)。无 GPU×步数墙钟 → 不可推算 hoursBase:相机+Patch Memory+tiled PRoPE 联合训 → Distill:Perceptual Flow Matching(teacher-forced)→ curriculum Self-Rollout DMD相机(内外参/PRoPE);第一人称 / 第三人称(0–4 主角参考图);文本双向 base + 3-step 因果蒸馏;1280×704 / 720p;单卡最高约 20 FPS(INT8 DiT + MG-LightVAE 等)Base+Distilled 权重与代码;GitHub Apache-2.0论文未报 WBenchSANA-WM one-minute bench(Simple/Hard):3.5 在单卡 720p 上综合强于 3.0(如 Hard overall 80.85 vs 3.0 的 78.79 等,见表)明确相对 Matrix-Game 3.0(同 5B Wan):几何记忆与蒸馏后的长程/单卡吞吐提升
Matrix-Game 3.0(前代)Wan2.2-TI2V-5BUE5 + AAA + 真实;约 4.8M video clips(论文)训练 GPU hours:未公开。推理:约 8 DiT + 1 VAE GPU → 最高 40 FPS@720p未公开动作/自校正 base + camera-aware memory + multi-segment DMD/Self-Forcing 对齐蒸馏 + 量化剪枝动作/相机;记忆检索5B;720p;最高约 40 FPS(多卡异步)开源(Skywork/Matrix-Game 系);许可以仓库为准部分第三方榜可见 MatrixGame3≈71.3 量级(非本文核验重点)长程记忆与实时 720p 自建/对比实验3.5 的直接同先验前代基线
Yume-1.5Wan2.2-TI2V-5B(文中 Wan2.2-5B,脚注 HF TI2V-5B)Real(Sekai 子集→键盘/鼠标)+ Synthetic(OpenVid 等 720p)+ Event(约 1 万 I2V 合成事件);精确总小时:未公开NVIDIA A100(卡数未公开);batch 40,lr 1e-5;foundation 10,000 iters → Self-Forcing+TSCM 600 iters未公开(缺卡数与墙钟;不可用「iters×未知卡」硬推 hours)Foundation(交替 T2V/I2V)→ Self-Forcing + TSCM(上下文压缩+线性注意力蒸馏)键盘/鼠标探索 + 文本世界事件因果流式;评测 4 steps;宣称 单卡 A100 约 12 fps@540p;训练分辨率 704×1280@16fps代码+5B/14B 权重;Apache-2.0Astronex 对照表转引 Full:68.9(†同 Wan 先验;非 Yume 原文主表,属团队转引)Yume-Bench(instruction-following 0.836 等)相对早期 Yume/Wan-2.1/MatrixGame:指令跟随显著提升
DreamX-World 1.0(5B)Wan2.2-TI2V-5BUE 精确相机 + 游戏动作 + 真实恢复几何;规模:未公开具体小时训练 GPU:未公开。延迟对比用 8×H20;部署宣称 8×RTX 5090 异步最高 16 FPS未公开相机 E-PRoPE → Memory-Conditioned Scene Persistence → Event Instruction Tuning → Causal forcing + DMD + long-rollout → RL(DiffusionNFT) 后蒸馏键盘式相机 WASD+IJKL;可组合文本事件;几何记忆检索因果 chunk+KV;约 704×1280@16fps;最长约 1 min;few-stepHF+GitHub;MIT文中讨论 WBench 设定,未给官方 Navi/Full 数字自建 5s basic(overall 84.76,camera 73.75)、30s long-horizon、memory consistency、人偏相对 HY-WorldPlay 1.5 / LingBot 等;同先验 5B 横比句有限
SolarWM-wan2.2-5BWan2.2 TI2V-5B(族内 wan2.2-5B)Solar Open Data:约 1.43M canonical clips / 25.85TB,10 源数据集(含 ABOT、DL3DV、SpatialVID 等)训练 GPU/hours:未公开未公开统一三阶段:双向 PRoPE 适配 → Teacher-Forced AnyFlow → DMD/SGF 少步因果(强调省去额外 Causal ODE/CD)相机(统一 metric 几何合同)因果;文中 fast 学生 4-step@16fps,输入约 1248×704 / 输出 1280×720;宣传分钟~小时级 rollout(仅在 5s 序列上训练)数据引擎+配方+多 backbone 权重;代码 Apache-2.0;权重许可见各 release 目录未公开 WBench 分数自建 in/OOD、分钟/小时级定性与一致性同配方可扩到 14B/22B/33B;5B 路线为可复现底座

2. 各模型 Stage 简表(附录)

Astronex-World 1.0(5 stages,均 2×L20)

Stage目标方法关键词数据要点
I Bidirectional control加相机+64D 动作全时序注意力 + flow matching;PRoPE;LoRAControl2V;DROID
II Block-causal结构改因果teacher forcing;block-causal maskControl2V
III Online UniPC traj.降采样步CF++:25-step teacher → 12-step studentControl2V
IV Mixed causal SFT恢复动态/跨域window 20 + sink 4;rolling forcingControl2V+CrossFPS+DrivingDojo+PhysicalAI
V Asymmetric DMD少步分布匹配causal self-rollout;双向 real-score;motion term同 IV → release DMD1545

Zing-0.5(4 stages)

Stage目标方法关键词
1 Bidirectional adaptation键盘+文本先验适配保留双向;混入无动作 T2I/T2V/I2V
2 Autoregressive dual-branch事件尺度监督段级双向多 prompt teacher + 块级 causal student
3 Consistency mid-training少步初始化teacher ODE + local consistency(类 CF++)
4 DMD (+DFD)实时 4-stepDecoupled DMD、Data-Forcing、rollout/replay

ABot-World-0

PhaseStage目标方法关键词
TeacherAction injection动作可控双向模型全参微调 Wan2.2;键盘动作;参考角色记忆
Student 1Teacher Forcing改因果clean history + causal mask
Student 2ODE Distillation少步冻结 Stage1 PF-ODE 端点回归
Student 3LongForcing抑长程漂移长 self-rollout ↔ 扩展视野双向 teacher 分布匹配

Matrix-Game 3.5

Stage目标方法关键词
Base几何一致长程Patch Memory(无额外可学参)+ tiled PRoPE;静/动态解耦
Distill-1少步因果初始化Perceptual Flow Matching(InternVideo2 特征)+ teacher-forced chunks
Distill-2推理对齐curriculum Self-Rollout DMD(先无 memory 再逐步打开)→ 3-step

Matrix-Game 3.0(前代摘要)

模块关键词
Base动作条件 + error buffer 自校正 + camera-aware memory
Distillmulti-segment DMD / Self-Forcing 对齐
DeployINT8 DiT、VAE prune、GPU 检索 → 最高约 40 FPS@720p(多卡)

Yume-1.5

Stage目标方法关键词
Foundation键盘世界探索+事件混合 Real/Synthetic/Event;交替 T2V/I2V;704×1280
Acceleration实时流式TSCM 上下文压缩 + Self-Forcing 双向注意力蒸馏;4-step 推理

DreamX-World 1.0

Stage关键词
CameraE-PRoPE(降空间 token 的投影式相机条件)
MemoryCamera-geometry retrieval + residual recycling / error injection
EventEvent Instruction Tuning(可组合多实体事件)
AR+DMDCausal forcing + DMD + long student rollout
PostRL / DiffusionNFT 恢复相机跟随与画质

SolarWM-wan2.2-5B

Stage关键词
0.5 / BidirectionalPRoPE 相机;5s TI2V;双向
1 TF-AnyFlowTeacher forcing + AnyFlow → 直接少步 AR 初始化(省 ODE/CD)
2 DMD/SGFSelf-rollout 分布匹配;4-step 因果学生

3. 「怎么读」选型洞察(工程向)

  1. 同先验 ≠ 同算力画像:Astronex 明确全流程仅 2×L20;Yume 报 A100 但缺卡数;ABot/Zing/Matrix/DreamX/Solar 训练 GPU hours 均未公开。选型时把「可复现训练预算」与「可下载推理权重」分开评估。
  2. 控制接口决定产品形态:键盘原生(Zing/ABot/Yume)利于游戏感;PRoPE/相机轨迹(Astronex/Matrix/Solar/DreamX)利于几何一致漫游与记忆回访;联合键盘+在线文本(Zing、Yume、DreamX 事件、Astronex event)更接近「可玩世界」。
  3. WBench 不可直接横向硬比:Zing Navi 81.0、Astronex Navi 73.5 / Full 70.0 为团队自述;ABot 主榜是 WorldRoamBench;Matrix 3.5 主榜是 SANA-WM one-minute;DreamX 自建 basic/30s。先对齐 split(Navi vs Full)与是否官方评测代码,再谈分数。
  4. 实时路径高度同构、细节不同:主流均为「双向 teacher → causal student → DMD/类 DMD」。差异在 LongForcing(ABot)Patch Memory + Perceptual FM(Matrix 3.5)AnyFlow 省中间蒸馏(Solar)RL 后蒸馏(DreamX)TSCM(Yume)——工程复现优先抄「与目标失败模式匹配」的那一段。
  5. 开源完整度:要「数据+配方+多 stage ckpt」看 SolarWM;要「桌面单卡 720p 交互」看 ABot;要「Navi 分数+联合文本」看 Zing;要「双形态权重+事件+低卡后训故事」看 Astronex;要「几何记忆+分钟级 720p」看 Matrix 3.5

4. 诚实边界:GPU hours 与规模未公开清单

模型GPU hours备注
Astronex-World 1.0未公开仅知 2×L20 + 若干 updates/checkpoints;无墙钟不可换算 hours
Zing-0.5未公开训练卡型/卡数未写;仅推理 8×5090
ABot-World-0未公开仅部署 1×5090;数据 500h 已开源,≠训练 compute
Matrix-Game 3.5未公开有 10k+1k 蒸馏步,无卡数/步时
Matrix-Game 3.0未公开有约 4.8M clips,无训练 hours
Yume-1.5未公开A100 + 10k/600 iters,卡数未知
DreamX-World 1.0未公开
SolarWM-wan2.2-5B未公开数据规模公开(1.43M clips),compute 未公开

其他未公开/需谨慎字段:多数模型的精确「训练小时视频」;Astronex 混合域各源采样比;Zing/DreamX 原始数据体量;ABot 是否严格写明字符串 TI2V-5B(本文按 Wan2.2 5B + HF 资产判定为同款纳入)。

剔除说明:Boundless 等 机器人操作世界模型 虽可能同 Wan 5B 后训,但不纳入本「交互探索视频 WM」主表,避免控制语义混淆。


5. 主要来源(核验日 2026-09-19,Asia/Shanghai)

  • Astronex-World 1.0: arXiv:2609.20034;HF Astronex-Lab/Astronex-World
  • Zing-0.5: arXiv:2609.17909;HF seedleap/zing-0.5
  • ABot-World-0: arXiv:2607.19191;HF acvlab/ABot-World-0-5B-LF;数据 acvlab/ABot-World-Explorer-500h
  • Matrix-Game 3.5: arXiv:2608.29910;GitHub Riemann-Dynamics/Matrix-Game-3.5
  • Matrix-Game 3.0: arXiv:2604.08995
  • Yume-1.5: arXiv:2512.22096;GitHub stdstu12/YUME
  • DreamX-World: arXiv:2606.16993;HF GD-ML/DreamX-World-5B
  • SolarWM: arXiv:2609.02886;HF junchaoh-cs/SolarWM-Wan2.2-5B

原始核验备忘已迁入本页。结构化卡片见 docs/models/data/models/*.yml

私有研究知识库 · 缺项写「未公开」· 禁止编造 GPU hours / 分数