跳到正文
今天10月8日周四1 条
  1. Microsoft Research64

    Microsoft Research Asia 开源 Agent Lightning v1.0:3,500 行代码的轻量 Harnessed Agentic RL 框架

    Microsoft Research Asia 发布 Harnessed Agentic RL 训练范式并开源重建版 Agent Lightning v1.0,让部署时使用的真实 agent harness 直接参与强化学习,无需在训练框架内重新实现 agent。

    推荐理由:框架让部署中真实的 agent harness 直接参与强化学习训练,无需重写 agent 逻辑,对构建可训练 agent 系统有直接参考价值。

10月7日周三
  1. Microsoft Research53

    Microsoft Research 播客:Jennifer Neville 谈 AI 的意外失败与评估方法

    Microsoft Research 播客中,Jennifer Neville 与 Chad Atalla 对谈 AI 系统评估与失败模式。她指出模型在多轮对话中的表现较单轮基准显著下降,长工作流中未及时捕捉的错误会累积并进一步干扰 AI;团队正研究强化学习方法改进,同时建议用户遇到问题时可重新完整指定单轮指令,并通过文本反馈精确描述失败以帮助改进模型。

10月2日周五
  1. GitHub Blog · AI & ML42

    GitHub:AI 正在改变开发者工作,三种能力需要加强

    GitHub 撰文指出 AI 正在改变开发者工作,建议重点强化三种能力:学会指挥多个 AI agent 而不只是使用 AI;不要轻信 AI 的第一次答案,可用第二个模型交叉评审(如 GitHub Copilot 内置的 Rubber Duck agent);把 AI 省下的实现时间用于理解需求、权衡架构等更重要的技术决策。文中强调开发者仍需为最终结果负责,审查和判断力不可省略。

9月30日周三
9月26日周六
  1. GitHub Blog · AI & ML58

    GitHub Copilot app 新手教程:如何用 canvases 搭建自定义工作流

    GitHub Copilot app 支持用 /create-canvas 技能通过自然语言生成 canvas 扩展,即可自定义的看板、检查清单、仪表盘等界面,无需手写代码。canvas 状态双向同步,用户和 Agent 可同时操作并实时看到彼此的更改;创建后可保存为团队共享或个人扩展,社区还通过 Awesome Copilot 提供现成模板。

9月25日周五
  1. GitHub Blog · AI & ML49

    GitHub Copilot app 的 canvas:聊天何时不是正确的 UI

    聊天仍是与 LLM 交互的主要方式,但在用户已明确任务时往往是错误的 UI。GitHub Copilot app 的 canvas 是运行在应用内、无浏览器界面的全栈小程序,可与 agent 双向通信,能调用第三方 API 并在本地执行代码。文章用 Connect 4 游戏、Winget 包管理、SQLite 操作及自动化开发工作流等示例说明:让 agent 构建工具比反复对话更省 token。

  2. GitHub Blog · AI & ML63

    GitHub Security Lab 推出基于 Taskflow Agent 的 LLM 自动化 fuzzing 流水线

    GitHub Security Lab 的 Antonio Morales 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的 LLM agent 自动化 fuzzing 流水线,只需提供 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++、读取覆盖率、改进 harness 并分诊 crash、生成漏洞报告。

    推荐理由:作者亲述把写 harness、读覆盖率、分诊 crash 交给 LLM agent 的完整设计,包括覆盖率反馈循环、plateau 停止条件和结构感知变异机制。

9月17日周四
  1. GitHub Blog · AI & ML69

    GitHub 用 Copilot 将 Copilot agent runtime 迁移到 80 万行生产 Rust

    GitHub 使用 Copilot 应用和 Copilot CLI 将 Copilot agent runtime 从 TypeScript 完全重写为 832,378 行生产 Rust,AI 智能体完成了大部分代码,跨 128 个合并到 main 的 pull request 增量发布,而非一次性切换。

    推荐理由:作者亲历复盘了用智能体将 Copilot 运行时整体移植到 Rust 的过程,给出可迁移的增量移植方法与大量一手会话数据。

7月29日周三
7月26日周日
  1. Berkeley AI Research44

    Berkeley AI Research 提出 ABBEL:让 LLM 更新信念状态以高效应对长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要表示为自然语言信念状态,并用信念评分监督其信息内容,以替代传统递归摘要的完整交互历史。在 CollabBench 协作编程任务上,基于重构的信念评分(ABBEL-rec-BG)将与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度远低于全上下文的 14.08×10²。

7月7日周二
板块