跳到正文
10月4日周日
  1. Hugging Face Blog71

    微软与 Hugging Face 发布智能体评估基准 ThinkingBox,按数据库终态评分

    微软与 Hugging Face 联合发布智能体评估环境与基准 ThinkingBox,按数据库最终状态而非生成文本给智能体打分。基准覆盖 507 个有状态业务流程,每任务重复运行 20 次,报告 pass@1、pass@20 与 20/20 一致性,约八成失败源于工具处理而非推理。代码、数据集与 OpenEnv 适配器均已开源开放。

    推荐理由:它把智能体评估从对话表现转向数据库留下的终态,并用 507 个流程、20 次重复给出可复现的一致性度量。

9月24日周四
  1. Hugging Face Blog57

    LFM2.5-VL-DSpark 加速视觉语言模型,端侧解码最高提速 3.13 倍

    Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,以投机解码加速视觉语言模型推理,端侧解码最高提速 3.13 倍,H100 上最高 2.66 倍。草稿模型约 280M 参数,使部署模型参数量仅增加 8.9%,首发支持 llama.cpp、MLX-VLM 和 SGLang。投机解码只加速解码阶段,视觉编码与 prefill 仍会限制端到端收益。