PhysVista: Benchmarking Physical Intelligence in VLMs via a Perception-Reasoning-Assessment Loop
PhysVista tests whether VLMs can judge physical consistency, not just recognize what is in a video.
The benchmark frames evaluation as a closed loop across physical state perception, dynamics reasoning, and plausibility assessment. It separates event-level and scale-level reasoning for more detailed diagnosis. The paper says tests across multiple VLMs found major weaknesses in physical reasoning and authenticity judgment, including on real-world and AI-generated videos. HF Daily Papers' note
The benchmark frames evaluation as a closed loop across physical state perception, dynamics reasoning, and plausibility assessment. It separates event-level and scale-level reasoning for more detailed diagnosis. The paper says tests across multiple VLMs found major weaknesses in physical reasoning and authenticity judgment, including on real-world and AI-generated videos. HF Daily Papers' note
score 4