每日论文 - 2025年09月26日
论文总数: 35
1. VCRL: Variance-based Curriculum Reinforcement Learning for Large
Language Models
作者: Guochao Jiang, Wenfeng Feng, Guofeng Quan, Chuzhan Hao, Yuewei Zhang, Guohua Liu, Hao Wang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-24 | 👍 点赞数: 109
摘要:
论文标题:VCRL:基于方差的课程强化学习用于大语言模型
中文摘要:
基于策略的强化学习目前在提升大语言模型(LLM)数学推理能力方面发挥着重要作用。然而,现有的基于 rollout 的强化学习方法(如 GRPO、DAPO、GSPO 等)未能显式地考虑大语言模型对不同难度样本的学习能力,这与人类在数学推理任务中从易到难的认知过程相悖。直观上,我们发现强化学习中的 rollout 组奖励方差在一定程度上反映了当前样本对大语言模型而言的难度:过于简单或过于困难的样本具有较低的方差,而中等难度的样本则表现出较高的方差。基于这一观察,我们提出了 VCRL——一种基于组奖励方差的课程式强化学习框架,能够根据奖励方差动态调控训 练样本的难度。在五个数学推理基准数据集和两种大语言模型上的实验结果表明,VCRL 显著优于当前的大语言模型强化学习基线方法。
2. MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and
Open Resources
作者: Sicong Leng, Jing Wang, Jiaxi Li, Hao Zhang, Zhiqiang Hu, Boqiang Zhang, Yuming Jiang, Hang Zhang, Xin Li, Lidong Bing, Deli Zhao, Wei Lu, Yu Rong, Aixin Sun, Shijian Lu
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-25 | 👍 点赞数: 90
摘要:
论文标题:MMR1:基于方差感知采样与开放资源的多模态推理能力增强
中文摘要:
大规模多模态推理模型已取得快速进展,但其发展受到两个主要因素的制约:一是缺乏公开的大规模、高质量长链式思维(Chain-of-Thought, CoT)数据;二是后训练阶段强化学习(Reinforcement Learning, RL)算法的不稳定性。当前RL微调的标准框架——组相对策略优化(Group Relative Policy Optimization, GRPO),在奖励方差较低时容易出现梯度消失问题,从而削弱优化信号并影响收敛效果。本文提出三项贡献:(1)我们提出了方差感知采样(Variance-Aware Sampling, VAS) ,这是一种基于方差促进评分(Variance Promotion Score, VPS)的数据选择策略,结合输出结果的方差与推理路径的多样性,以提升奖励方差,稳定策略优化过程;(2)我们发布了大规模且精心筛选的资源,包含约160万条长链CoT冷启动数据和约1.5万对RL问答数据,旨在保证数据的质量、难度与多样性,并提供完全可复现的端到端训练代码库;(3)我们开源了一系列多种规模的多模态推理模型,为学术界建立了标准化的基准。在多个数学推理基准上的实验验证了所构建数据集与提出的VAS方法的有效性,全面的消融研究与分析进一步揭示了各组件的贡献。此外,我们从理论上证明了奖励方差对策略梯度期望幅度的下界约束,而VAS正是实现该理论保障的一种实用机制。我们的代码、数据及模型检查点已公开于 https://github.com/LengSicong/MMR1。
3. SciReasoner: Laying the Scientific Reasoning Ground Across Disciplines
作者: Yizhou Wang, Chen Tang, Han Deng, Jiabei Xiao, Jiaqi Liu, Jianyu Wu, Jun Yao, Pengze Li, Encheng Su, Lintao Wang, Guohang Zhuang, Yuchen Ren, Ben Fei, Ming Hu, Xin Chen, Dongzhan Zhou, Junjun He, Xiangyu Yue, Zhenfei Yin, Jiamin Wu, Qihao Zheng, Yuhao Zhou, Huihui Xu, Chenglong Ma, Yan Lu, Wenlong Zhang, Chunfeng Song, Philip Torr, Shixiang Tang, Xinzhu Ma, Wanli Ouyang, Lei Bai