跳到正文
今天10月8日周四2 条
  1. Microsoft Research64

    Microsoft Research Asia 开源 Agent Lightning v1.0:3,500 行代码的轻量 Harnessed Agentic RL 框架

    Microsoft Research Asia 发布 Harnessed Agentic RL 训练范式并开源重建版 Agent Lightning v1.0,让部署时使用的真实 agent harness 直接参与强化学习,无需在训练框架内重新实现 agent。

    推荐理由:框架让部署中真实的 agent harness 直接参与强化学习训练,无需重写 agent 逻辑,对构建可训练 agent 系统有直接参考价值。

10月7日周三
  1. Microsoft Research53

    Microsoft Research 播客:Jennifer Neville 谈 AI 的意外失败与评估方法

    Microsoft Research 播客中,Jennifer Neville 与 Chad Atalla 对谈 AI 系统评估与失败模式。她指出模型在多轮对话中的表现较单轮基准显著下降,长工作流中未及时捕捉的错误会累积并进一步干扰 AI;团队正研究强化学习方法改进,同时建议用户遇到问题时可重新完整指定单轮指令,并通过文本反馈精确描述失败以帮助改进模型。

10月5日周一
  1. GitHub Blog · AI & ML55

    GitHub 发布开源基准 ReviewBench 用于评估 AI 代码审查

    GitHub 发布离线基准 ReviewBench,用于评测 AI 代码审查 Agent。基准基于 103.9M 真实 pull request 的分布建模,包含 219 个跨 19 种语言的公开 PR,采用人审、静态分析和多个 frontier LLM 构建的多源 golden set,以 Claude Sonnet 5 作为评分模型,资深工程师独立复检一致率达 96.6%。

10月1日周四
  1. Microsoft Research43

    Microsoft Research 用机器学习预测电网空间天气风险

    微软研究院开发了一套机器学习系统,可对美国本土 66,935 座变电站提供位置级空间天气风险预测,提前 30-60 分钟预警地磁感应电流(GIC)风险。该系统结合 L1 点太阳风观测、AE 和 Dst 指数预测及本地地质电导率数据,其中 Dst 预测在 2020-2026 评估期峰值活动时段有 62.2% 的小时数优于 Burton 方程。

9月29日周二
  1. Microsoft Research60

    Microsoft Research 发布生物学 AI 研究系统 Quine

    Microsoft Research 推出 Quine,一个包含生物学世界模型和交互式 harness 的 AI 研究系统,可连接科学工具、文献和研究者。与 Broad Institute 合作中,Quine 用一个周末从数千化合物中筛选出候选药物,湿实验验证其能诱导胰腺癌细胞状态最大幅度转变,部分强效化合物具有意想不到的作用机制。

    推荐理由:官方介绍了 Quine 的系统构成和在 PDAC 上的湿实验验证结果,读者可以据此了解 AI 驱动生物学研究的实际工作方式。

9月26日周六
  1. GitHub Blog · AI & ML58

    GitHub Copilot app 新手教程:如何用 canvases 搭建自定义工作流

    GitHub Copilot app 支持用 /create-canvas 技能通过自然语言生成 canvas 扩展,即可自定义的看板、检查清单、仪表盘等界面,无需手写代码。canvas 状态双向同步,用户和 Agent 可同时操作并实时看到彼此的更改;创建后可保存为团队共享或个人扩展,社区还通过 Awesome Copilot 提供现成模板。

9月25日周五
  1. GitHub Blog · AI & ML49

    GitHub Copilot app 的 canvas:聊天何时不是正确的 UI

    聊天仍是与 LLM 交互的主要方式,但在用户已明确任务时往往是错误的 UI。GitHub Copilot app 的 canvas 是运行在应用内、无浏览器界面的全栈小程序,可与 agent 双向通信,能调用第三方 API 并在本地执行代码。文章用 Connect 4 游戏、Winget 包管理、SQLite 操作及自动化开发工作流等示例说明:让 agent 构建工具比反复对话更省 token。

  2. GitHub Blog · AI & ML63

    GitHub Security Lab 推出基于 Taskflow Agent 的 LLM 自动化 fuzzing 流水线

    GitHub Security Lab 的 Antonio Morales 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的 LLM agent 自动化 fuzzing 流水线,只需提供 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++、读取覆盖率、改进 harness 并分诊 crash、生成漏洞报告。

    推荐理由:作者亲述把写 harness、读覆盖率、分诊 crash 交给 LLM agent 的完整设计,包括覆盖率反馈循环、plateau 停止条件和结构感知变异机制。

9月24日周四
9月21日周一
9月18日周五
  1. GitHub Blog · AI & ML36

    读懂 AI 代码、RAG 已死?GitHub Podcast 逐条拆解五大 AI 热点观点

    GitHub Podcast 逐条检验五个 AI 领域的热点观点:AI 生成的代码仍需审查,但可按风险分层分配注意力;Skills 并没有杀死 MCP——MCP 提供标准化工具与数据接入,Skills 以 Markdown 打包团队经验,两者互补。RAG 也没有消亡,好的检索能让模型更接近答案、减少 token 浪费,agent、Skills、MCP 与 RAG 可以在同一工作流中共存。

9月17日周四
  1. GitHub Blog · AI & ML69

    GitHub 用 Copilot 将 Copilot agent runtime 迁移到 80 万行生产 Rust

    GitHub 使用 Copilot 应用和 Copilot CLI 将 Copilot agent runtime 从 TypeScript 完全重写为 832,378 行生产 Rust,AI 智能体完成了大部分代码,跨 128 个合并到 main 的 pull request 增量发布,而非一次性切换。

    推荐理由:作者亲历复盘了用智能体将 Copilot 运行时整体移植到 Rust 的过程,给出可迁移的增量移植方法与大量一手会话数据。

9月1日周二
板块