WorldForge × MiniMax-H3
通用视频模型的原生条件通道,能替代 inference-time 引导吗?

WorldForge 的 pipeline 是 warping → 重绘,其中重绘靠三个推理时设计(IRR / FLF / DSG)把轨迹引导注入扩散过程。 本实验把重绘阶段整体换成 MiniMax-H3 的原生条件通道(reference / SDEdit / retake-inpaint),去掉全部 inference-time 设计, 只喂首帧 + warp 视频,看通用模型能否零成本顶上。
training-freeMiniMax-H3 (Ref2VA) 单卡 H200 · bf16masked 定量评测n=2 场景 · 证据中等

一句话结论

11.3a1 纯 in-context 在 two_car 的 masked PSNR — 重画了一个几何不同的新场景,不跟轨迹
25.8a2 SDEdit 的 masked PSNR(最高)— 但代价是根本不填洞
a3唯一真去填洞的臂 — 但大洞上变色 / 画崩
没有一条臂能同时「跟上轨迹」和「填好洞」——这正是 WorldForge 那套引导存在的理由
评测锚点:warp 帧在 WorldForge mask 的保留区(白)是几何正确的。该区 masked PSNR ↑ = 轨迹保真; LPIPS↓ 是相对 warp 的整体差异;MUSIQ↑ 是无参考观感(补洞质量的间接信号)。各臂统一 resize 到同画布,resize 偏差对所有臂一致。

逐格对比

同一批 warp 输入、同一 prompt、同一 seed,只换条件通道。H3 三臂WorldForge 原生 Wan / LongCat 并排。点任意视频可播放/暂停全部。

定量总表

三条臂的机理

a1 纯 in-context(用户原设计) — references=[首帧 image, warp video],纯噪声起点。 H3 的 reference 通道与 target 用不同 RoPE grid、参考被缩到短边 768,只借运动、不借像素外观。 two_car 上 masked PSNR 仅 11.3、LPIPS 0.70:它生成了流畅视频、把洞填满了,但几何是自己重画的,不是 warp 的轨迹。 精确复现了 NovaVSR 先验。

a2 SDEdit — 把 warp 加噪到 σ 作为起点。保真最好(PSNR 25.8、LPIPS 0.10), 但不填洞:低噪起点改不动黑洞,退化成「高保真复制 warp」,没解决 disocclusion。

a3 retake inpaint — retake_video=warp + inpaint_mask=洞(注意极性:WorldForge mask 白=保留,H3 mask 1=重画,需取反)。 唯一真去填洞的臂,但大洞上变色 / 出现伪影。可能与 H3 retake 的 mask 时间粒度(17 帧一个 VAE clip 取并集,洞随镜头变大被过度挖)有关,也可能是模型在大面积缺失上本就不稳。

对照 · WorldForge 原生 — Wan / LongCat 带完整 IRR/FLF/DSG,masked PSNR ~20(比 a2 低,因为它们真重画了洞、保留区也略动), 但既填洞又整体协调。用一点保真换来了正确的 disocclusion 重绘——这是三条 H3 臂都做不到的。

附录 · WorldForge 复现(4 模块全跑通)

上游 warping 阶段的产物(喂给上面重绘阶段的输入)。完整复现说明见仓库 REPRODUCTION.md

数据自 experiments/h3_backbone/output/_metrics.json 自动生成 · 环境 envs/diffsynth(torch 2.12)· 8×H200 并行 · ⚠️ 证据强度:n=2 场景、参数未搜索、masked 仅 PSNR。结论为待验假设级。