Microsoft Research 播客:Jennifer Neville 谈 AI 的意外失败与评估方法
Microsoft Research 播客中,Jennifer Neville 与 Chad Atalla 对谈 AI 系统评估与失败模式。她指出模型在多轮对话中的表现较单轮基准显著下降,长工作流中未及时捕捉的错误会累积并进一步干扰 AI;团队正研究强化学习方法改进,同时建议用户遇到问题时可重新完整指定单轮指令,并通过文本反馈精确描述失败以帮助改进模型。
Microsoft Research 播客中,Jennifer Neville 与 Chad Atalla 对谈 AI 系统评估与失败模式。她指出模型在多轮对话中的表现较单轮基准显著下降,长工作流中未及时捕捉的错误会累积并进一步干扰 AI;团队正研究强化学习方法改进,同时建议用户遇到问题时可重新完整指定单轮指令,并通过文本反馈精确描述失败以帮助改进模型。
NVIDIA 面向全球博士生开放第 26 届 Graduate Fellowship Program 申请,每人奖金最高 60,000 美元。项目支持 AI、机器学习、自动驾驶、机器人、医疗等领域的研究,自 2002 年以来已发放超过 220 笔、总额约 800 万美元的资助。申请截止日期为 2026 年 10 月 30 日,获选者须在 2027 年夏季先到 NVIDIA 研究办公室进行线下实习。
Microsoft Research 推出 Quine,一个包含生物学世界模型和交互式 harness 的 AI 研究系统,可连接科学工具、文献和研究者。与 Broad Institute 合作中,Quine 用一个周末从数千化合物中筛选出候选药物,湿实验验证其能诱导胰腺癌细胞状态最大幅度转变,部分强效化合物具有意想不到的作用机制。
推荐理由:官方介绍了 Quine 的系统构成和在 PDAC 上的湿实验验证结果,读者可以据此了解 AI 驱动生物学研究的实际工作方式。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要表示为自然语言信念状态,并用信念评分监督其信息内容,以替代传统递归摘要的完整交互历史。在 CollabBench 协作编程任务上,基于重构的信念评分(ABBEL-rec-BG)将与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度远低于全上下文的 14.08×10²。