Native Action-Prior Learning from Videos for World Action Models
NAVA-WAM pretrains a robot action policy directly from videos that have no action labels.
The paper’s claim is that observation-only video can teach action-relevant priors without first building a separate latent-action model. Its two-stage setup pretrains on visual transitions, then post-trains with action-labeled demonstrations for robot control. The authors report stronger in-distribution and out-of-distribution results than prior approaches, plus better action-label efficiency and real-robot generalization. Source: HF Daily Papers' note
The paper’s claim is that observation-only video can teach action-relevant priors without first building a separate latent-action model. Its two-stage setup pretrains on visual transitions, then post-trains with action-labeled demonstrations for robot control. The authors report stronger in-distribution and out-of-distribution results than prior approaches, plus better action-label efficiency and real-robot generalization. Source: HF Daily Papers' note
score 5