跳到正文
  1. Hugging Face Blog71

    微软与 Hugging Face 发布智能体评估基准 ThinkingBox,按数据库终态评分

    微软与 Hugging Face 联合发布智能体评估环境与基准 ThinkingBox,按数据库最终状态而非生成文本给智能体打分。基准覆盖 507 个有状态业务流程,每任务重复运行 20 次,报告 pass@1、pass@20 与 20/20 一致性,约八成失败源于工具处理而非推理。代码、数据集与 OpenEnv 适配器均已开源开放。

    推荐理由:它把智能体评估从对话表现转向数据库留下的终态,并用 507 个流程、20 次重复给出可复现的一致性度量。

  1. Hugging Face Blog73

    H Company 发布 Holo4 通用计算机操作智能体模型,含 27B 与 35B-A3B 两版本

    H Company 发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两版本,并推出基于 Nemotron 3 Nano Omni 的 Holotron4 Nano。

    推荐理由:原文给出了 Holo4 在 OSWorld 2.0 上与 Opus 5.5 等闭源模型的分数和成本对比,可帮助判断开源通用 agent 模型当前的能力位置。

  1. NVIDIA Blog61

    NVIDIA 与 Google DeepMind 等如何借助开放科学帮助研究者备战下一场大流行

    NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构发布超过 2800 种病毒的蛋白复合物预测 3D 结构,开放到 AlphaFold 数据库,为下一场大流行提前储备结构知识。

    推荐理由:开放超过 2800 种病毒的蛋白复合物预测结构,让科研界提前储备应对下一轮大流行的结构知识,并配套开源可复用的预测工作流。

  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两个实时语音对话模型,主打智能提升与并行推理,用户可用语音完成复杂任务。

    推荐理由:语音模型在对话延迟、多步推理和成本之间给出新选项,并公布了多个语音基准排名,便于开发者选型。

  1. Google DeepMind75

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型,关键地表变量分辨率达 5 公里

    Google DeepMind 与 Google Research 发布旗舰天气 AI 模型 WeatherNext 3,据 Brightband 独立实时评测为当前最先进、最准确的全球天气模型。

    推荐理由:原文给出了 WeatherNext 3 相比前代在分辨率与更新频率上的提升,以及搜索、Gemini、Maps 等产品的接入范围,可据此了解 AI 天气预报的最新进展。

已经到底了