Megadose AI progress, ranked and analyzed.

Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model

· HF Daily Papers ·
Dynin-Robotics uses one diffusion trajectory model to connect goals, predicted scene changes, and robot actions.

The paper builds on Dynin-Omni, representing language, images, goals, and actions as discrete tokens in a shared masked-diffusion setup. The same model is trained across action prediction, future-observation prediction, terminal goal prediction, and instruction reconstruction. After continual pretraining on about 1.33 million trajectories from 48 Open X-Embodiment datasets, it reports gains on VLABench, competitive LIBERO results, and a 78.4% average success rate across four Franka Research 3 manipulation conditions. The authors also report up to a 29.2x speedup in model-side action decoding with an optimized block-parallel implementation. HF Daily Papers' note

score 5

Categories: Research