微软与 Hugging Face 发布智能体评估基准 ThinkingBox,按数据库终态评分
微软与 Hugging Face 联合发布智能体评估环境与基准 ThinkingBox,按数据库最终状态而非生成文本给智能体打分。基准覆盖 507 个有状态业务流程,每任务重复运行 20 次,报告 pass@1、pass@20 与 20/20 一致性,约八成失败源于工具处理而非推理。代码、数据集与 OpenEnv 适配器均已开源开放。
推荐理由:它把智能体评估从对话表现转向数据库留下的终态,并用 507 个流程、20 次重复给出可复现的一致性度量。