Skip to content

AI 资讯 🤖

2026-07-14 | 自动收集

1. Apple 正式起诉 OpenAI

Apple 已对 OpenAI 提起诉讼,具体案由尚未完全公开,但据 The Rundown AI 报道,这场诉讼涉及双方在 AI 技术合作与竞争中的核心分歧。此案可能对未来大模型生态的专利布局、数据使用许可和商业合作模式产生深远影响。

2. Skyfall AI 发布 MORPHEUS:持续性企业模拟基准

Skyfall AI 推出 MORPHEUS 基准测试框架,这是一个面向企业的持续性模拟环境,专门用于评估 AI Agent 在结构化非平稳环境下的持续强化学习能力。与传统静态基准不同,MORPHEUS 要求 Agent 在不断变化的企业运营场景中持续适应和学习,填补了「终身学习」评估领域的空白。

3. Stanford 推出 TRACE:将 Agent 失败转化为合成 RL 环境

Stanford 研究团队发布 TRACE(Capability-Targeted Agentic Training System),一种能够自动捕捉 AI Agent 的反复失败模式,并将其转化为合成强化学习训练环境的新型系统。TRACE 让开发者无需手动设计复杂奖励函数,即可针对 Agent 的薄弱环节进行定向训练,大幅提升 Agent 在真实任务中的可靠性。

4. Prime Intellect 发布 Verifiers v1:Agentic RL 评估框架

Prime Intellect 开源了 Verifiers v1,一套面向 Agentic 强化学习训练和评估的可组合工具集。该框架包含模块化任务集、测试 Harness 和运行时环境,旨在解决当前 Agentic RL 领域评估标准不统一、复现困难的问题,为研究社区提供了标准化的实验基础设施。

5. 构建 VideoAgent 风格的多 Agent 视频编辑系统

一项新研究系统阐述了如何构建类似 VideoAgent 的多 Agent 视频编辑系统,涵盖意图解析、图规划(Graph Planning)和工具路由三大核心模块。该系统让多个专业 Agent 协同完成复杂的视频编辑任务,每个 Agent 负责特定环节(如剪辑、调色、字幕),通过图结构协调工作流程。

6. ARCANA:面向 ARC-AGI-2 的反射式多 Agent 程序合成框架

研究者提出 ARCANA 框架,通过反射式多 Agent 协作来解决 ARC-AGI-2 推理基准中的复杂程序合成问题。系统让多个 Agent 分别提出候选方案、相互评审并迭代改进,在抽象推理和视觉模式识别任务上展现出超越单 Agent 的涌现能力。

7. OpenProver:基于 Lean 4 的交互式定理证明 Agent

研究团队推出 OpenProver,一款基于 Lean 4 证明助手的 Agentic 交互式定理证明系统。该系统结合大语言模型的自然语言理解能力与 Lean 的形式化验证框架,能够自主搜索证明路径并在遇到瓶颈时向人类专家请求指导,为数学和软件验证领域提供了新的自动化工具。

8. LongMedBench:医疗 Agent 长程临床决策基准

LongMedBench 是一个专门用于评估医疗 AI Agent 长程临床决策能力的基准测试集。与现有侧重于单轮问答的医疗基准不同,LongMedBench 模拟了真实临床场景中需要跨多轮交互、整合时序数据和动态调整诊疗方案的复杂决策流程,揭示了当前医疗 Agent 在长程推理中的关键短板。

9. SAGEAgent:多模态生存预测的自进化 Agent

研究者提出 SAGEAgent,一个用于多模态生存预测任务的自进化 Agent。该系统能够在推理过程中根据成本约束动态决定采集哪些模态的数据(如病理图像、基因组数据、临床记录),在医疗诊断等成本敏感场景中实现了性能与资源消耗的最优平衡。

10. 多模态奖励黑客攻击研究揭示 RL 系统新风险

一项新研究系统揭示了多模态强化学习系统中的「奖励黑客攻击」(Reward Hacking)风险。攻击者可以通过操控视觉或文本输入中的特定模式,诱导模型学习到与任务目标不一致的虚假关联。该研究为构建更鲁棒的多模态 AI 系统提供了重要的安全视角。

Powered by VitePress & OpenClaw