GitHub 发布开源基准 ReviewBench 用于评估 AI 代码审查
GitHub 发布离线基准 ReviewBench,用于评测 AI 代码审查 Agent。基准基于 103.9M 真实 pull request 的分布建模,包含 219 个跨 19 种语言的公开 PR,采用人审、静态分析和多个 frontier LLM 构建的多源 golden set,以 Claude Sonnet 5 作为评分模型,资深工程师独立复检一致率达 96.6%。
GitHub 发布离线基准 ReviewBench,用于评测 AI 代码审查 Agent。基准基于 103.9M 真实 pull request 的分布建模,包含 219 个跨 19 种语言的公开 PR,采用人审、静态分析和多个 frontier LLM 构建的多源 golden set,以 Claude Sonnet 5 作为评分模型,资深工程师独立复检一致率达 96.6%。
GitHub 撰文指出 AI 正在改变开发者工作,建议重点强化三种能力:学会指挥多个 AI agent 而不只是使用 AI;不要轻信 AI 的第一次答案,可用第二个模型交叉评审(如 GitHub Copilot 内置的 Rubber Duck agent);把 AI 省下的实现时间用于理解需求、权衡架构等更重要的技术决策。文中强调开发者仍需为最终结果负责,审查和判断力不可省略。
GitHub Copilot app 支持用 /create-canvas 技能通过自然语言生成 canvas 扩展,即可自定义的看板、检查清单、仪表盘等界面,无需手写代码。canvas 状态双向同步,用户和 Agent 可同时操作并实时看到彼此的更改;创建后可保存为团队共享或个人扩展,社区还通过 Awesome Copilot 提供现成模板。
聊天仍是与 LLM 交互的主要方式,但在用户已明确任务时往往是错误的 UI。GitHub Copilot app 的 canvas 是运行在应用内、无浏览器界面的全栈小程序,可与 agent 双向通信,能调用第三方 API 并在本地执行代码。文章用 Connect 4 游戏、Winget 包管理、SQLite 操作及自动化开发工作流等示例说明:让 agent 构建工具比反复对话更省 token。
GitHub Copilot 应用重建了 Pull Request 视图,可流畅打开 2,200 个文件、超百万行变更和 400 多条行内评论的开源 PR。
GitHub Podcast 逐条检验五个 AI 领域的热点观点:AI 生成的代码仍需审查,但可按风险分层分配注意力;Skills 并没有杀死 MCP——MCP 提供标准化工具与数据接入,Skills 以 Markdown 打包团队经验,两者互补。RAG 也没有消亡,好的检索能让模型更接近答案、减少 token 浪费,agent、Skills、MCP 与 RAG 可以在同一工作流中共存。
GitHub 使用 Copilot 应用和 Copilot CLI 将 Copilot agent runtime 从 TypeScript 完全重写为 832,378 行生产 Rust,AI 智能体完成了大部分代码,跨 128 个合并到 main 的 pull request 增量发布,而非一次性切换。
推荐理由:作者亲历复盘了用智能体将 Copilot 运行时整体移植到 Rust 的过程,给出可迁移的增量移植方法与大量一手会话数据。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要表示为自然语言信念状态,并用信念评分监督其信息内容,以替代传统递归摘要的完整交互历史。在 CollabBench 协作编程任务上,基于重构的信念评分(ABBEL-rec-BG)将与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度远低于全上下文的 14.08×10²。