跳到正文
今天10月8日周四1 条
  1. Microsoft Research64

    Microsoft Research Asia 开源 Agent Lightning v1.0:3,500 行代码的轻量 Harnessed Agentic RL 框架

    Microsoft Research Asia 发布 Harnessed Agentic RL 训练范式并开源重建版 Agent Lightning v1.0,让部署时使用的真实 agent harness 直接参与强化学习,无需在训练框架内重新实现 agent。

    推荐理由:框架让部署中真实的 agent harness 直接参与强化学习训练,无需重写 agent 逻辑,对构建可训练 agent 系统有直接参考价值。

10月7日周三
10月5日周一
  1. GitHub Blog · AI & ML55

    GitHub 发布开源基准 ReviewBench 用于评估 AI 代码审查

    GitHub 发布离线基准 ReviewBench,用于评测 AI 代码审查 Agent。基准基于 103.9M 真实 pull request 的分布建模,包含 219 个跨 19 种语言的公开 PR,采用人审、静态分析和多个 frontier LLM 构建的多源 golden set,以 Claude Sonnet 5 作为评分模型,资深工程师独立复检一致率达 96.6%。

9月25日周五
  1. GitHub Blog · AI & ML63

    GitHub Security Lab 推出基于 Taskflow Agent 的 LLM 自动化 fuzzing 流水线

    GitHub Security Lab 的 Antonio Morales 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的 LLM agent 自动化 fuzzing 流水线,只需提供 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++、读取覆盖率、改进 harness 并分诊 crash、生成漏洞报告。

    推荐理由:作者亲述把写 harness、读覆盖率、分诊 crash 交给 LLM agent 的完整设计,包括覆盖率反馈循环、plateau 停止条件和结构感知变异机制。

9月21日周一
9月1日周二
板块