GitHub Blog · AI & ML· Michelle Zhou·· 2 天前AI 评分55
GitHub 发布开源基准 ReviewBench 用于评估 AI 代码审查
ReviewBench: An open benchmark for AI code review
AI 导读
GitHub 发布离线基准 ReviewBench,用于评测 AI 代码审查 Agent。基准基于 103.9M 真实 pull request 的分布建模,包含 219 个跨 19 种语言的公开 PR,采用人审、静态分析和多个 frontier LLM 构建的多源 golden set,以 Claude Sonnet 5 作为评分模型,资深工程师独立复检一致率达 96.6%。
来源:GitHub Blog · AI & ML · github.blog