Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning
Trace builds verifiable visual-reasoning tasks by separating scene generation from answer checking.
The paper describes an environment with 1,000 tasks across 277 scene grammars and 11 visual domains. Each instance shares a semantic state that controls the rendered image, prompt, typed answer, verifier state, and replay trace. Training Qwen2.5-VL models on 64,000 Trace instances improved macro-average results across 24 external benchmarks by 3.51 points for 3B and 4.06 points for 7B. Source: HF Daily Papers' note.
The paper describes an environment with 1,000 tasks across 277 scene grammars and 11 visual domains. Each instance shares a semantic state that controls the rendered image, prompt, typed answer, verifier state, and replay trace. Training Qwen2.5-VL models on 64,000 Trace instances improved macro-average results across 24 external benchmarks by 3.51 points for 3B and 4.06 points for 7B. Source: HF Daily Papers' note.
score 5