OpenAI 发布内部模型产出的 722 篇数学论文,含准黎曼猜想结果
Latent Space AINews 汇总:OpenAI 公布内部前沿模型产出的 722 篇数学论文(372 个结果族),覆盖约 4000 个研究问题,平均每个结果约 3 小时 ChatGPT Pro 算力,其中准黎曼猜想(Result 003)被数学家 Levent Alpöge 称为数学史上最重要时刻,结果尚未经独立验证。
Latent Space AINews 汇总:OpenAI 公布内部前沿模型产出的 722 篇数学论文(372 个结果族),覆盖约 4000 个研究问题,平均每个结果约 3 小时 ChatGPT Pro 算力,其中准黎曼猜想(Result 003)被数学家 Levent Alpöge 称为数学史上最重要时刻,结果尚未经独立验证。
MIT Technology Review 基于 300 位数据、AI 及技术高管调研的报告指出,缺乏知识是企业 AI 智能体项目难以落地的主要原因,平均仅 34% 的 agentic 项目进入生产环境。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,在 DeepSWE v1.1 上超 GPT-6 Sol 6.4 分、在 AutomationBench 上超 Opus 5.5 2.2 分;Agent Arena 排名 #5,每任务中位成本 $0.56,比 GPT-6 Sol 便宜 39%。
微软研究院开发了一套机器学习系统,可对美国本土 66,935 座变电站提供位置级空间天气风险预测,提前 30-60 分钟预警地磁感应电流(GIC)风险。该系统结合 L1 点太阳风观测、AE 和 Dst 指数预测及本地地质电导率数据,其中 Dst 预测在 2020-2026 评估期峰值活动时段有 62.2% 的小时数优于 Burton 方程。
Microsoft Research 宣布在开源的 Physical AI Toolchain 中新增推理卸载能力,支持用 Kubernetes 在机器人、边缘和云端 GPU 间容器化部署和编排机器人 AI 工作负载。
Microsoft Research 在 Nature 发表逆合成预测框架 RetroChimera,结合基于 Transformer 的 R-SMILES 2 与基于 GNN 的 NeuralLoc 两个互补子模型,通过学习式重排序融合预测。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要表示为自然语言信念状态,并用信念评分监督其信息内容,以替代传统递归摘要的完整交互历史。在 CollabBench 协作编程任务上,基于重构的信念评分(ABBEL-rec-BG)将与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度远低于全上下文的 14.08×10²。
Berkeley AI Research 提出 GRASP,一种针对学习型世界模型的梯度规划器,让长时域规划变得实用。其核心改进包括:将轨迹提升到虚拟状态使优化在时间上并行、在状态迭代中直接加入随机性以支持探索、重塑梯度以获得干净的动作信号。该方法旨在解决长时域 rollout 中雅可比矩阵条件数随时间指数级缩放导致的梯度爆炸/消失以及非贪心损失面局部极小等问题。
Berkeley AI Research 介绍 SPEX 和 ProxySPEX 两种算法,利用稀疏性、低阶性和层级性等结构特性,把 LLM 特征、数据和模型组件归因中的交互识别转化为稀疏恢复问题,规模比以往方法提升数个数量级。ProxySPEX 借助层级结构,用约 10x 更少的 ablation 达到与 SPEX 相当的性能,并在长上下文特征归因任务中保持高 faithfulness。
Berkeley AI Research 在 NeurIPS 2025 论文中提出一个直接基于信息含量评估和优化成像系统的框架,仅需带噪测量数据和噪声模型即可估计互信息。该方法在彩色摄影、射电天文、无透镜成像和显微成像四个领域验证,信息估计可预测解码器性能;据此优化的设计达到与最先进端到端方法相当的效果,同时所需内存和计算更少,且无需针对任务设计解码器。