每日论文 - 2025年08月31日
论文总数: 19
1. rStar2-Agent: Agentic Reasoning Technical Report
作者: Ning Shang, Yifei Liu, Yi Zhu, Li Lyna Zhang, Weijiang Xu, Xinyu Guan, Buze Zhang, Bingcheng Dong, Xudong Zhou, Bowen Zhang, Ying Xin, Ziming Miao, Scarlett Li, Fan Yang, Mao Yang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-28 | 👍 点赞数: 95
摘要:
我们推出了rStar2-Agent,这是一款经过代理强化学习训练的14B数学推理模型,旨在实现前沿水平的性能。除了当前的长链思维链(CoT)能力外,该模型还展示了先进的认知行为,例如在使用Python编码工具之前进行深思熟虑,并根据代码执行反馈进行反思,以自主探索、验证和优化复杂问题解决中的中间步骤。这一能力得益于三项关键创新,使得代理强化学习在大规模应用中更加有效:(i) 一种高效的强化学习基础设施,配备可靠的Python代码环境,支持高吞吐量执行并降低高rollout成本,从而在有限的GPU资源(64 MI300X GPUs)上进行训练;(ii) GRPO-RoC,一种具有“正确重采样”(Resample-on-Correct)rollout策略的代理强化学习算法,能够应对编码工具带来的固有环境噪声,使模型在代码环境中更有效地进行推理;(iii) 一种高效的代理训练方案,从非推理的监督微调(SFT)开始,并逐步过渡到多阶段的强化学习阶段,在最小计算成本下培养出高级认知能力。最终,rStar2-Agent仅在一周内通过510步强化学习,将一个预训练的14B模型提升至当前最先进的水平,在AIME24和AIME25上分别实现了平均pass@1得分80.6%和69.8%,显著超越了DeepSeek-R1(671B),同时生成的响应更短。此外,rStar2-Agent-14B在对齐、科学推理和代理工具使用任务中也展现出强大的泛化能力。 代码和训练方案可在https://github.com/microsoft/rStar获取。
2. Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable
Text-to-Image Reinforcement Learning
作者: Yibin Wang, Zhimin Li, Yuhang Zang, Yujie Zhou, Jiazi Bu, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-28 | 👍 点赞数: 85
摘要:
Pref-GRPO: 基于成对偏好奖励的GRPO方法实现稳定的文本到图像强化学习
近期研究进展凸显了基于GRPO的强化学习方法及基准测试在提升文本到图像(T2I)生成方面的重要性。然而,当前方法使用逐点奖励模型(pointwise reward model, RM)对生成图像进行评分时容易受到奖励黑客(reward hacking)的影响。我们发现,当图像间细微的评分差异在归一化后被放大时,会形成虚假的优势,促使模型过度优化微小收益,最终导致图像生成过程的不稳定。为解决这一问题,我们提出了Pref-GRPO,一种基于成对偏好奖励的GRPO方法,将优化目标从评分最大化转变为偏好拟合,从而实现更稳定的训练过程。在Pref-GRPO中,通过偏好RM在每组内对图像进行成对比较,并以胜率作为奖励信号。大量实验表明,Pref-GRPO能够区分图像质量的细微差异,提供更稳定的增益,缓解奖励黑客问题。此外,现有的T2I基准测试受限于粗粒度的评估标准,难以全面评估模型性能。为此,我们引入了UniGenBench,一个统一的T2I基准测试集,涵盖5个主要主题和20个子主题,共计600 个提示词。该基准通过10项主要标准和27项子标准评估语义一致性,并利用多模态大语言模型(MLLM)进行构建与评估。我们的基准测试揭示了开源与闭源T2I模型的优劣势,并验证了Pref-GRPO的有效性。
3. MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World
Tasks via MCP Servers
作者: Zhenting Wang, Qi Chang, Hemani Patel, Shashank Biju, Cheng-En Wu, Quan Liu, Aolin Ding, Alireza Rezazadeh, Ankit Shah, Yujia Bao, Eugene Siow
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-28 | 👍 点赞数: 56
摘要:
我们推出了MCP-Bench,这是一个用于评估大语言模型(LLMs)在现实多步骤任务中表现的基准测试工具,这些任务需要使用工具、跨工具协调、精确参数控制以及任务求解所需的规划/推理能力。MCP-Bench基于Model Context Protocol(MCP)构建,通过28个具有代表性的实时MCP服务器将LLMs与涵盖金融、旅行、科学计算和学术搜索等多个领域的250个工具连接起来。与以往基于API的基准测试不同,每个MCP服务器提供一组设计为协同工作的互补工具,从而能够构建具有丰富输入输出耦合的真实多步骤任务。MCP-Bench中的 任务测试代理从模糊指令中检索相关工具(无需明确工具名称)、为复杂目标规划多步骤执行路径、基于中间工具输出生成响应,以及协调跨领域工作流的能力,而这些能力在现有依赖明确工具规范、浅层少步骤流程和孤立领域操作的基准测试中未能得到充分评估。我们提出了一个涵盖工具级模式理解与使用、路径级规划和任务完成的多维度评估框架。针对20种先进LLMs的实验表明,MCP-Bench仍存在持续挑战。 代码和数据:https://github.com/Accenture/mcp-bench。
4. USO: Unified Style and Subject-Driven Generation via Disentangled and
Reward Learning
作者: Shaojin Wu, Mengqi Huang, Yufeng Cheng, Wenxu Wu, Jiahe Tian, Yiming Luo, Fei Ding, Qian He
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-26 | 👍 点赞数: 54
摘要:
现有研究通常将风格驱动生成和主体驱动生成视为两个互斥的任务:前者强调风格相似性,而后者注重主体一致性,导致两者之间存在明显的对立关系。我们认为这两个目标可以在一个统一的框架下实现,因 为它们本质上都涉及内容与风格的解耦与重组,这一直是风格驱动研究中的核心问题。为此,我们提出了USO(Unified Style-Subject Optimized),一种统一风格与主体优化的定制化生成模型。首先,我们构建了一个包含内容图像、风格图像及其对应风格化内容图像的大规模三元组数据集。其次,我们引入了一种解耦学习策略,通过两种互补的目标——风格对齐训练和内容-风格解耦训练,同时实现风格特征的对齐以及内容与风格的分离。第三,我们引入了一种风格奖励学习范式(SRL, Style Reward Learning),以进一步提升模型性能。最后,我们发布了USO-Bench,这是首个能够同时在多个指标上联合评估风格相似性与主体保真度的基准测试集。大量实验表明,USO在主体一致性和风格相似性两个维度上均取得了优于现有开源模型的性能。 代码与模型地址:https://github.com/bytedance/USO
5. AWorld: Orchestrating the Training Recipe for Agentic AI
作者: Chengyue Yu, Siyuan Lu, Chenyi Zhuang, Dong Wang, Qintong Wu, Zongyue Li, Runsheng Gan, Chunfeng Wang, Siqi Hou, Gaochi Huang, Wenlong Yan, Lifeng Hong, Aohui Xue, Yanfeng Wang, Jinjie Gu, David Tsai, Tao Lin
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-28 | 👍 点赞数: 37
摘要:
摘要:实践学习范式对于开发强大的Agentic AI系统至关重要,但其在复杂基准(如GAIA)中受到经验生成效率低下的严重制约。为解决这一问题,我们提出了AWorld,一个专为大规模智能体-环境交互设计的开源系统。通过在集群上分布任务,AWorld的经验收集速度相较于标准的单节点顺序执行提升了14.6倍。这一关键性的加速使强化学习变得切实可行且具备可扩展性。基于此能力,我们训练了一个以Qwen3-32B为基础的智能体,其性能显著优于基线模型,将整体GAIA准确率从21.59%提升至32.23%。在该基准测试最具挑战性的层级上,我们的智能体取得了16.33%的得分,超越了领先商业模型的表现。我们的开源系统及所构建的智能体为完整的Agentic AI训练流程提供了一个实用蓝图,从高效交互到可验证的模型改进。
6. Mixture of Contexts for Long Video Generation
作者: Shengqu Cai, Ceyuan Yang, Lvmin Zhang, Yuwei Guo, Junfei Xiao, Ziyan Yang, Yinghao Xu, Zhenheng Yang, Alan Yuille, Leonidas Guibas, Maneesh Agrawala, Lu Jiang, Gordon Wetzstein
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-28 | 👍 点赞数: 27
摘要:
长视频生成本质上是一个长上下文记忆问题:模型必须在长时间范围内保留并检索显著事件,而不发生崩溃或漂移。然而,将扩散变换器(diffusion transformers)扩展到长上下文视频生成受到自注意力机制二次计算成本的根本限制,这使得长序列的内存和计算难以处理且难以优化。我们将长上下文视频生成重新定义为一项内部信息检索任务,并提出一种简单且可学习的稀疏注意力路由模块——上下文混合(Mixture of Contexts, MoC),作为有效的长期记忆检索引擎。在MoC中,每个查询动态选择若干信息丰富的片段以及必要的锚点(caption、局部窗口)进行关注,通过因果路由(causal routing)防止循环闭合。随着我们对数据进行扩展并逐步稀疏化路由,模型将计算资源分配给显著的历史信息,从而在数分钟的内容中保持身份、动作和场景的一致性。效率作为检索机制的副产品得以实现(近线性扩展),从而支持实际的训练与合成,并在分钟级尺度上实现记忆与一致性的涌现。
7. TCIA: A Task-Centric Instruction Augmentation Method for Instruction
Finetuning
作者: Simin Ma, Shujian Liu, Jun Tan, Yebowen Hu, Song Wang, Sathish Reddy Indurthi, Sanqiang Zhao, Liwei Wu, Jianbing Han, Kaiqiang Song