跳转至

FAST-WAM

116 个字

并非构建了一个新的 WAM 的架构,是在探究,对于 WAM 来说,预测下一帧的视频对于 action 到底有没有用,如果有用的话,是在训练阶段还是在推理阶段

image-20260914185900123

基于一个 MoT 系统,通过 joint 预测 VAE Action field 大小,然后在推理的时候,不再进行 Video DiT 的输出,只进行一次 foward 得到一个 latent frame,然后 action 输出完整的 chunk