跳到正文
GitHub Blog · AI & ML· Michelle Zhou·· 3 小时前精选AI 评分68

ReviewBench:面向 AI 代码评审的开放评测基准

ReviewBench: An open benchmark for AI code review

AI 导读

GitHub 发布面向 AI 代码评审的开放基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布分析构建,包含 219 个公开 PR。基准采用多来源黄金集和统一评价标准,高级工程师独立复核的一致性达 96.6%。GitHub 用它评估 Copilot code review 时,离线预测方向与线上 A/B 实验一致。

推荐理由

原文给出 ReviewBench 的构建方法,以及离线评测与线上 A/B 实验的对照结果,可作为评估代码评审智能体的一种参考。

来源:GitHub Blog · AI & ML · github.blog