FAST-WAM¶
约 116 个字
并非构建了一个新的 WAM 的架构,是在探究,对于 WAM 来说,预测下一帧的视频对于 action 到底有没有用,如果有用的话,是在训练阶段还是在推理阶段

基于一个 MoT 系统,通过 joint 预测 VAE 和 Action 的 field 大小,然后在推理的时候,不再进行 Video DiT 的输出,只进行一次 foward 得到一个 latent frame,然后 action 输出完整的 chunk
约 116 个字
并非构建了一个新的 WAM 的架构,是在探究,对于 WAM 来说,预测下一帧的视频对于 action 到底有没有用,如果有用的话,是在训练阶段还是在推理阶段

基于一个 MoT 系统,通过 joint 预测 VAE 和 Action 的 field 大小,然后在推理的时候,不再进行 Video DiT 的输出,只进行一次 foward 得到一个 latent frame,然后 action 输出完整的 chunk