An End-to-End Agent Auditing Engine
A²E is built to compare agent harnesses beyond simple task correctness.
The paper introduces an Agent Task Protocol for plugging evaluation tasks into different harnesses, plus an instrumented monitor that records standardized execution traces. Its evaluation layer scores execution efficiency, tool use, planning, and error recovery. The authors report wide variation across model-harness pairings, with no single combination winning across every task. HF Daily Papers' note
The paper introduces an Agent Task Protocol for plugging evaluation tasks into different harnesses, plus an instrumented monitor that records standardized execution traces. Its evaluation layer scores execution efficiency, tool use, planning, and error recovery. The authors report wide variation across model-harness pairings, with no single combination winning across every task. HF Daily Papers' note
score 4