Terminal-Bench-Science: Evaluating AI agents on scientific research workflows

发生了什么
A benchmark for evaluating AI agents on research workflows across scientific domains
摘要按规则整理自下方来源原文

A benchmark for evaluating AI agents on research workflows across scientific domains
摘要按规则整理自下方来源原文