跳到正文
10月4日周日
  1. Hugging Face Blog71

    微软与 Hugging Face 发布智能体评估基准 ThinkingBox,按数据库终态评分

    微软与 Hugging Face 联合发布智能体评估环境与基准 ThinkingBox,按数据库最终状态而非生成文本给智能体打分。基准覆盖 507 个有状态业务流程,每任务重复运行 20 次,报告 pass@1、pass@20 与 20/20 一致性,约八成失败源于工具处理而非推理。代码、数据集与 OpenEnv 适配器均已开源开放。

    推荐理由:它把智能体评估从对话表现转向数据库留下的终态,并用 507 个流程、20 次重复给出可复现的一致性度量。

10月2日周五
  1. GitHub Blog · AI & ML39

    GitHub Blog:AI 正在改变开发者工作,有三项技能需要加强

    AI 正在改变开发者工作方式,GitHub Blog 建议开发者重点加强三项技能:学会引导 AI 智能体、不轻信 AI 的首次回答、用 AI 解决更大的问题。文章以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明可用第二个模型评审首个模型的计划、代码和测试,再由开发者自行判断。开发者仍要对最终结果负责,并把节省的时间用于提升判断力与技术决策。

9月28日周一
9月26日周六
  1. GitHub Blog · AI & ML58

    GitHub Copilot app 入门教程:如何用画布构建自定义工作流

    GitHub Copilot app 的画布功能允许用户通过 /create-canvas 技能用自然语言描述工作流,由 agent 自动生成无需编码的可自定义共享界面。画布双向共享,两端操作实时同步,创建后可保存为扩展供个人或团队复用。文末列出设计画布的三个自问问题,并推荐 Awesome Copilot 社区现成扩展。

9月25日周五
  1. GitHub Blog · AI & ML58

    GitHub Copilot 官方博客:为何聊天是错误界面,canvas 如何取而代之

    GitHub Copilot 官方博客提出,聊天不是与 AI 交互的正确界面,应该用 canvas 构建自定义 UI 来完成任务。文章演示了用 canvas 制作 Connect 4 游戏、Winget 包管理界面和 SQLite 数据库界面,并主张让代理构建工具而非把代理当工具,以减少 token 浪费并简化开发工作流。