外观
DreamX-World 1.0
E-PRoPE 相机 + 几何记忆 + 事件指令微调,后接 causal/DMD 与 RL(DiffusionNFT)。许可为 MIT。
结构化 stub:仓库内 data/models/dreamx-world-1.0.yml。
核验字段
| 字段 | 值 |
|---|---|
| 名称 | DreamX-World 1.0 |
| 机构 | GD-ML(HF:GD-ML/DreamX-World-5B) |
| 公开时间 | arXiv:2606.16993 |
| arXiv | 2606.16993 |
| 参数量 | 5B |
| 基座 | initialized from Wan2.2-TI2V-5B |
| 分辨率 | 约 704×1280@16fps |
| 帧率 | 部署宣称 8×RTX 5090 异步最高 16 FPS;延迟对比用 8×H20 |
| 延迟 | 未公开单独首帧毫秒(有 8×H20 延迟对比设定,精确数字以论文为准) |
| 控制 | 键盘式相机 WASD+IJKL;可组合文本事件;几何记忆检索 |
| 模态 | 视频 |
| 时长口径 | 因果 chunk+KV;最长约 1 min;few-step |
| 开源 | 是 |
| 许可 | MIT(HF+GitHub) |
| GPU hours | 未公开 |
| 训练硬件 | 训练 GPU:未公开。延迟对比 8×H20;部署宣称 8×RTX 5090 |
| WBench | 文中讨论 WBench 设定,未给官方 Navi/Full 数字 |
| 其他评测 | 自建 5s basic(overall 84.76,camera 73.75)、30s long-horizon、memory consistency、人偏(团队自述) |
| 核验日 | 2026-09-19 |
训练阶段
Camera E-PRoPE → Memory-Conditioned Scene Persistence → Event Instruction Tuning → Causal forcing + DMD + long-rollout → RL / DiffusionNFT 后蒸馏。
选型要点
同先验 5B 里少见「RL 后蒸馏」与「可组合多实体事件」。几何记忆在少步阶段要课表,见记忆矩阵 B 行。
诚实边界
训练 hours 与原始数据体量未公开。自建 bench 不可与 WBench Navi/Full 直接横比。
来源
另见 Wan5B 后训对照、WM 全景、控制接口差异。