跳到正文
GitHub Blog · AI & ML· Michelle Zhou·· 2 天前AI 评分55

GitHub 发布开源基准 ReviewBench 用于评估 AI 代码审查

ReviewBench: An open benchmark for AI code review

AI 导读

GitHub 发布离线基准 ReviewBench,用于评测 AI 代码审查 Agent。基准基于 103.9M 真实 pull request 的分布建模,包含 219 个跨 19 种语言的公开 PR,采用人审、静态分析和多个 frontier LLM 构建的多源 golden set,以 Claude Sonnet 5 作为评分模型,资深工程师独立复检一致率达 96.6%。

来源:GitHub Blog · AI & ML · github.blog

板块