Terminal-Bench-Science: Evaluating AI agents on scientific research workflows
Terminal-Bench-Science introduces a benchmark for testing AI agents on realistic scientific research workflows in terminal environments.
Excerpt
HN · 101 points · 29 comments
Read at source: https://www.terminal-bench-science.ai/announcement