← 返回事件
持续讨论AI

Terminal-Bench-Science: Evaluating AI agents on scientific research workflows

图:Hacker News

发生了什么

A benchmark for evaluating AI agents on research workflows across scientific domains

摘要按规则整理自下方来源原文

为什么在扩散

来源