跳到正文
  1. Hugging Face Blog71

    微软与 Hugging Face 发布智能体评估基准 ThinkingBox,按数据库终态评分

    微软与 Hugging Face 联合发布智能体评估环境与基准 ThinkingBox,按数据库最终状态而非生成文本给智能体打分。基准覆盖 507 个有状态业务流程,每任务重复运行 20 次,报告 pass@1、pass@20 与 20/20 一致性,约八成失败源于工具处理而非推理。代码、数据集与 OpenEnv 适配器均已开源开放。

    推荐理由:它把智能体评估从对话表现转向数据库留下的终态,并用 507 个流程、20 次重复给出可复现的一致性度量。

  1. Hugging Face Blog73

    H Company 发布 Holo4 通用计算机操作智能体模型,含 27B 与 35B-A3B 两版本

    H Company 发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两版本,并推出基于 Nemotron 3 Nano Omni 的 Holotron4 Nano。

    推荐理由:原文给出了 Holo4 在 OSWorld 2.0 上与 Opus 5.5 等闭源模型的分数和成本对比,可帮助判断开源通用 agent 模型当前的能力位置。

已经到底了