同一批 warp 输入、同一 prompt、同一 seed,只换条件通道。H3 三臂与 WorldForge 原生 Wan / LongCat 并排。点任意视频可播放/暂停全部。
a1 纯 in-context(用户原设计) — references=[首帧 image, warp video],纯噪声起点。 H3 的 reference 通道与 target 用不同 RoPE grid、参考被缩到短边 768,只借运动、不借像素外观。 two_car 上 masked PSNR 仅 11.3、LPIPS 0.70:它生成了流畅视频、把洞填满了,但几何是自己重画的,不是 warp 的轨迹。 精确复现了 NovaVSR 先验。
a2 SDEdit — 把 warp 加噪到 σ 作为起点。保真最好(PSNR 25.8、LPIPS 0.10), 但不填洞:低噪起点改不动黑洞,退化成「高保真复制 warp」,没解决 disocclusion。
a3 retake inpaint — retake_video=warp + inpaint_mask=洞(注意极性:WorldForge mask 白=保留,H3 mask 1=重画,需取反)。 唯一真去填洞的臂,但大洞上变色 / 出现伪影。可能与 H3 retake 的 mask 时间粒度(17 帧一个 VAE clip 取并集,洞随镜头变大被过度挖)有关,也可能是模型在大面积缺失上本就不稳。
对照 · WorldForge 原生 — Wan / LongCat 带完整 IRR/FLF/DSG,masked PSNR ~20(比 a2 低,因为它们真重画了洞、保留区也略动), 但既填洞又整体协调。用一点保真换来了正确的 disocclusion 重绘——这是三条 H3 臂都做不到的。
上游 warping 阶段的产物(喂给上面重绘阶段的输入)。完整复现说明见仓库 REPRODUCTION.md。
experiments/h3_backbone/output/_metrics.json 自动生成 · 环境 envs/diffsynth(torch 2.12)· 8×H200 并行 ·
⚠️ 证据强度:n=2 场景、参数未搜索、masked 仅 PSNR。结论为待验假设级。