跳到正文
10月7日周三
  1. Microsoft Research53

    Microsoft Research 播客:Jennifer Neville 谈 AI 的意外失败与评估方法

    Microsoft Research 播客中,Jennifer Neville 与 Chad Atalla 对谈 AI 系统评估与失败模式。她指出模型在多轮对话中的表现较单轮基准显著下降,长工作流中未及时捕捉的错误会累积并进一步干扰 AI;团队正研究强化学习方法改进,同时建议用户遇到问题时可重新完整指定单轮指令,并通过文本反馈精确描述失败以帮助改进模型。

10月6日周二
  1. About Amazon27

    Dhar Mann 称其 AWNY 1 亿美元创作者交易目标已获认领

    创作者 Dhar Mann 担任纽约 Advertising Week 首位首席创作者官,目标是在 12 个月内促成 1 亿美元的创作者与品牌合作,并称多位未具名 CMO 的承诺总额已超过 1 亿美元基准。他通过"creator challenge"、"Masked CMO"等活动撮合双方,并表示本周不会签署合同,意在缩短创作者与 CMO 之间的沟通层级。

10月5日周一
  1. GitHub Blog · AI & ML55

    GitHub 发布开源基准 ReviewBench 用于评估 AI 代码审查

    GitHub 发布离线基准 ReviewBench,用于评测 AI 代码审查 Agent。基准基于 103.9M 真实 pull request 的分布建模,包含 219 个跨 19 种语言的公开 PR,采用人审、静态分析和多个 frontier LLM 构建的多源 golden set,以 Claude Sonnet 5 作为评分模型,资深工程师独立复检一致率达 96.6%。

  2. MIT Technology Review · AI21

    让预测分析迈入 Agentic AI 时代

    2026 年企业 AI 的核心问题已不再是预测模型能否超越统计预测,而是如何让预测系统在不偏离业务意图的前提下自主行动。深度学习与生成式 AI 支持的实时训练让模型持续演进,预测引擎的数据来源也扩展到非结构化交互数据,推动企业从被动事后分析走向前瞻性预判。

  3. MIT Technology Review · AI59

    MIT科技评论:人们为何一边厌恶AI一边离不开它

    作者Will Douglas Heaven分析全球对AI爱恨交织的矛盾现象:Pew调查显示美国成年人中认为AI会带来负面影响的多于正面,Gallup 5月民调中71%美国成年人反对在当地新建AI数据中心;但ChatGPT 5月月活达10亿,Gemini 7月达9.5亿,Pew称一半美国成年人使用聊天机器人。

10月3日周六
10月2日周五
  1. MIT Technology Review · AI23

    MIT Technology Review 报告:用自主 AI 重新定义企业智能

    MIT Technology Review Insights 报告提出"agentic shift"(智能体化转变),认为企业 AI 需要从工具转向运营模式,实时连接人员、流程与数据并配套治理。报告指出全球 AI 投资将在 2026 年达 2.5 万亿美元、同比增长 44%,但多数企业仍未靠 AI 增收。可持续获得回报的企业以流程重设计为先,并依托主权、可组合的数据基础实现就地查询与准备数据。

  2. GitHub Blog · AI & ML42

    GitHub:AI 正在改变开发者工作,三种能力需要加强

    GitHub 撰文指出 AI 正在改变开发者工作,建议重点强化三种能力:学会指挥多个 AI agent 而不只是使用 AI;不要轻信 AI 的第一次答案,可用第二个模型交叉评审(如 GitHub Copilot 内置的 Rubber Duck agent);把 AI 省下的实现时间用于理解需求、权衡架构等更重要的技术决策。文中强调开发者仍需为最终结果负责,审查和判断力不可省略。

  3. MIT Technology Review · AI60

    AlphaGo 核心成员 Thore Graepel 撰文:LLM 并不真正推理

    AlphaGo 团队前核心成员、UCL 教授 Thore Graepel 撰文指出,LLM 的链式推理仍是 next-token 预测,并非真正的推理,并列举三大缺陷:无可检查的认知状态、知识与推理纠缠在权重中、思维链常是事后编造。他 recently 离开 Google DeepMind,主张借鉴 AlphaGo 的博弈树架构,让系统维护可审计的认知状态并按证据更新信念。

  4. NVIDIA Blog60

    OpenAI 推出 GPT-6 Astra Ultrafast,基于 NVIDIA Blackwell GPU 实现 8x token 生成加速

    OpenAI 推出 GPT-6 Astra Ultrafast 模式,运行在 NVIDIA Blackwell GPU 上,现已通过 OpenAI API 及面向符合资格的 ChatGPT Work 和 Codex 用户开放,token 生成速度最高比 Astra Standard 模式快 8x。

    推荐理由:原文给出 8x 提速数字、开放入口和受益场景,读者可以据此评估该模式对编码智能体工作流的影响。

板块