每日论文 - 2025年09月19日
论文总数: 20
1. ScaleCUA: Scaling Open-Source Computer Use Agents with Cross-Platform Data
作者: Zhaoyang Liu, JingJing Xie, Zichen Ding, Zehao Li, Bowen Yang, Zhenyu Wu, Xuehui Wang, Qiushi Sun, Shi Liu, Weiyun Wang, Shenglong Ye, Qingyun Li, Zeyue Tian, Gen Luo, Xiangyu Yue, Biqing Qi, Kai Chen, Bowen Zhou, Yu Qiao, Qifeng Chen, Wenhai Wang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-18 | 👍 点赞数: 92
摘要:
论文标题:ScaleCUA:通过跨平台数据扩展开源计算机使用代理
中文摘要:
视觉-语言模型(Vision-Language Models, VLMs)使得能够自主操作图形用户界面(GUI)的计算机使用代理(Computer Use Agents, CUAs)成为可能,展现出巨大潜力。然而,由于缺乏大规模、开源的计算机使用数据和基础模型,该领域的发展受到限制。在本研究中,我们提出了ScaleCUA,旨在推动开源CUA系统的规模化发展。我们构建了一个覆盖6种操作系统和3个任务领域的大型数据集,该数据集通过一个结合自动化代理与人类专家的闭环流水线生成。基于这一大规模数据训练出的ScaleCUA能够在不同平台之间无缝操作。具体而言,该模型在多个基准上显著优于基线方法(在WebArena-Lite-v2上提升+26.6,在ScreenSpot-Pro上提升+10.7),并在多个权威测试集上创下新的最先进性能记录(MMBench-GUI L1-Hard达到94.4%,OSWorld-G达到60.6%,WebArena-Lite-v2达到47.4%)。这些结果凸显了数据驱动规模化对于通用型计算机使用代理的重要作用。我们将公开发布数据、模型和代码,以促进后续研究:https://github.com/OpenGVLab/ScaleCUA。
2. FlowRL: Matching Reward Distributions for LLM Reasoning
作者: Xuekai Zhu, Daixuan Cheng, Dinghuai Zhang, Hengli Li, Kaiyan Zhang, Che Jiang, Youbang Sun, Ermo Hua, Yuxin Zuo, Xingtai Lv, Qizheng Zhang, Lin Chen, Fanghao Shao, Bo Xue, Yunchong Song, Zhenjie Yang, Ganqu Cui, Ning Ding, Jianfeng Gao, Xiaodong Liu, Bowen Zhou, Hongyuan Mei, Zhouhan Lin
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-18 | 👍 点赞数: 83
摘要:
论文标题:FlowRL:通过匹配奖励分布实现大语言模型推理
中文摘要:
我们提出了FlowRL:一种通过流平衡(flow balancing)来匹配完整奖励分布的方法,而非在大语言模型(LLM)的强化学习(RL)中单纯最大化奖励。近期先进的推理模型普遍采用奖励最大化方法(例如PPO和GRPO),这类方法容易过度优化主导性奖励信号,而忽视那些出现频率较低但合理的推理路径,从而导致生成结果的多样性下降。相比之下,我们引入可学习的配分函数,将标量奖励转化为归一化的目标分布,并最小化策略分布与该目标分布之间的逆KL散度。我们将这一思想实现为一种流平衡 优化方法,有效促进多样化的探索以及具有泛化能力的推理轨迹。我们在数学推理和代码推理任务上进行了实验验证:在数学基准测试中,FlowRL相比GRPO平均提升了10.0%,相比PPO提升了5.1%;在代码推理任务上也 consistently 表现出更优性能。实验结果表明,奖励分布匹配是实现高效探索与多样化推理的关键步骤,对大语言模型强化学习的发展具有重要意义。
3. Reasoning over Boundaries: Enhancing Specification Alignment via
Test-time Delibration
作者: Haoran Zhang, Yafu Li, Xuyang Hu, Dongrui Liu, Zhilin Wang, Bo Li, Yu Cheng
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-18 | 👍 点赞数: 47
摘要:
论文标题:跨越边界进行推理:通过测试时推理增强规范对齐
中文摘要:
大语言模型(LLMs)正被 increasingly 应用于多种现实场景中,每个场景都由用户或组织定制的行为与安全规范(spec)所约束。这些规范可分为安全规范(safety-spec)和行为规范(behavioral-spec),在不同场景中各不相同,并随偏好和需求的变化而动态演进。我们将这一挑战形式化为“规范对齐”问题,聚焦于大语言模型在行为 与安全两个维度上遵循动态、特定场景规范的能力。为应对该挑战,我们提出了Align3——一种轻量级方法,采用测试时推理(Test-Time Deliberation, TTD),结合分层反思与修订机制,对规范边界进行深入推理。同时,我们构建了SpecBench,一个统一的规范对齐评测基准,涵盖5个场景、103项规范和1,500个提示语。在15个推理模型和18个指令微调模型上的实验,结合包括Self-Refine、TPO和MoreThink在内的多种TTD方法,得出三项关键发现:(i)测试时推理能够有效提升规范对齐能力;(ii)Align3以极低开销推动了安全性与有用性之间的权衡前沿;(iii)SpecBench能有效揭示当前模型在规范对齐方面的不足。这些结果凸显了测试时推理作为应对现实世界规范边界推理任务的一种高效策略的潜力。
4. Evolving Language Models without Labels: Majority Drives Selection,
Novelty Promotes Variation
作者: Yujun Zhou, Zhenwen Liang, Haolin Liu, Wenhao Yu, Kishan Panaganti, Linfeng Song, Dian Yu, Xiangliang Zhang, Haitao Mi, Dong Yu
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-18 | 👍 点赞数: 29
摘要:
论文标题:无需标签的语言模型进 化:多数决定选择,新颖性促进变异
中文摘要:
大型语言模型(LLMs)正越来越多地通过可验证奖励的强化学习(RLVR)进行训练。然而,在实际应用中,人们期望模型能够在没有标签或外部评判的情况下实现自我提升。现有的无标签方法——如置信度最小化、自一致性或多數投票目标——虽然能够稳定学习过程,但会持续抑制探索行为,导致熵崩溃现象:生成结果变得更短、多样性降低,且鲁棒性变差。与以往诸如测试时强化学习(Test-Time Reinforcement Learning, TTRL)等主要针对当前无标签数据集进行适应性调整的方法不同,我们的目标更为广泛:在不牺牲模型内在探索能力和泛化性能的前提下实现通用性的持续改进,即“进化”。我们对此问题进行了形式化建模,并提出了一种面向进化的无标签强化学习框架(EVOL-RL),该方法在无标签环境下将稳定性与变异性有机结合。EVOL-RL以多数投票答案作为稳定的锚点(选择机制),同时引入一种基于语义空间的新颖性感知奖励机制,鼓励产生不同于已有推理路径的回答(变异机制)。该方法基于GRPO实现,并采用非对称裁剪策略保留强反馈信号,辅以熵正则项维持搜索能力。这种“多数用于选择 + 新颖性用于变异”的设计有效防止了多样性崩溃,保持了更长且更具信息量的思维链,显著提升了 pass@1 和 pass@n 指标。实验表明,EVOL-RL 始终优于仅依赖多数投票的 TTRL 基线方法;例如,在无标签的 AIME24 数据集上训练后,Qwen3-4B-Base 模型在 AIME25 上的 pass@1 从 TTRL 的 4.6% 提升至 16.4%,pass@16 则从 18.5% 提高到 37.9%。EVOL-RL 不仅避免了多样性退化,还在跨领域任务(如 GPQA)中展现出更强的泛化能力。此外,我们还证明 EVOL-RL 在 RLVR 设定下同样能提升性能,进一步凸显其广泛的适用性。
5. Understand Before You Generate: Self-Guided Training for Autoregressive
Image Generation
作者: Xiaoyu Yue, Zidong Wang, Yuqing Wang, Wenlong Zhang, Xihui Liu, Wanli Ouyang, Lei Bai, Luping Zhou
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-18 | 👍 点赞数: 26
摘要:
论文标题:生成之前先理解:自指导训练的自回归图像生成方法
中文摘要:
近期研究表明,高质量的视觉表征在图像生成中具有重要作用,同时也揭示了生成模型在图像理解能力上的局限性。作为最初为自然语言设计的一种生成范式,自回归模型在应用于视觉任务时也面临类似的挑战。本文首次系统性地探讨了将“下一个标记预测”(next-token prediction)范式应用于视觉领域的机制问题。我们识别出阻碍高层视觉语义学习的三个关键因素:局部性和条件依赖性、跨步长的语义不一致性,以及空间不变性缺失。我们证明,通过在训练过程中引入自监督目标,可以有效缓解这些问题,从而提出一种新颖的训练框架——自回归模型的自指导训练(Self-guided Training for AutoRegressive models, ST-AR)。该方法无需依赖预训练的表征模型,显著提升了自回归模型的图像理解能力,并改善了生成质量。具体而言,在保持相同采样策略的前提下,ST-AR使LlamaGen-L的FID指标提升了约42%,LlamaGen-XL的FID指标提升了约49%。
6. FinSearchComp: Towards a Realistic, Expert-Level Evaluation of Financial
Search and Reasoning
作者: Liang Hu, Jianpeng Jiao, Jiashuo Liu, Yanle Ren, Zhoufutu Wen, Kaiyuan Zhang, Xuanliang Zhang, Xiang Gao, Tianci He, Fei Hu, Yali Liao, Zaiyuan Wang, Chenghao Yang, Qianyu Yang, Mingren Yin, Zhiyuan Zeng, Ge Zhang, Xinyi Zhang, Xiying Zhao, Zhenwei Zhu, Hongseok Namkoong, Wenhao Huang, Yuwen Tang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-16 | 👍 点赞数: 24
摘要:
论文标题:FinSearchComp:迈向真实、专家级的金融搜索与推理能力评估
摘要:
搜索已成为基于大语言模型(LLM)智能体的核心基础设施,被广泛视为实现更通用智能的关键路径之一。金融领域尤其具有挑战性,是理想的验证场景:分析师通常需要在时效性强、专业性高的数据上进行复杂、多步骤的搜索,这使其成为评估搜索能力与知识驱动推理的理想领域。然而,目前尚无公开的金融数据集能够对端到端智能体的数据搜索能力进行全面评测,主要原因在于构建真实且复杂的任务需要深厚的金融专业知识,而时效性数据也难以有效评估。
本文提出 FinSearchComp——首个完全开源的、面向真实开放域金融搜索与推理的智能体评测基准。FinSearchComp 包含三项任务:时效数据获取、简单历史查询和复杂历史调查,紧密复现了现实世界中金融分析师的工作流程。为确保任务难度与标注可靠性,我们邀请了70位专业金融专家参与标注,并建立了严格的多阶段质量保障流程。该基准共包含635个问题,覆盖全球市场及大中华区市场,我们在该基准上评测了21个模型(或产品)。实验结果显示,Grok 4(网页版)在全局子集上表现最佳,准确率接近专家水平;DouBao(网页版)在大中华区子集中领先。进一步分析表明,为智能体配备网络搜索功能和金融专用插件可显著提升其在 FinSearchComp 上的表现,且模型及其工具的国家来源对性能有显著影响。通过贴近真实分析师任务并提供端到端的评估方式,FinSearchComp 为复杂金融搜索与推理提供了专业化、高难度的测试平台。
7. WorldForge: Unlocking Emergent 3D/4D Generation in Video Diffusion Model
via Training-Free Guidance
作者: Chenxi Song, Yanming Yang, Tong Zhao, Ruibo Li, Chi Zhang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-18 | 👍 点赞数: 21
摘要:
论文标题:WorldForge:通过无需训练的引导机制解锁视频扩散模型中的涌现式3D/4D生成
中文摘要:
近年来,视频扩散模型因其丰富的潜在世界先验,在空间智能任务中展现出强大的潜力。然而,这类模型在可控性方面的局限性以及几何结构上的不一致性,限制了其强大先验知识在实际3D/4D任务中的应用。因此,现有方法往往依赖重新训练或微调,但这可能导致预训练知识的退化,并带来高昂的计算成本。为解决这一问题,我们提出了WorldForge——一种无需训练、在推理阶段即可使用的框架,该框架由三个紧密耦合的模块组成。步内递归优化(Intra-Step Recursive Refinement) 在推理过程中引入递归优化机制,在每一步去噪过程中反复优化网络预测,从而实现精确的轨迹注入;光流门控潜在融合(Flow-Gated Latent Fusion) 利用光流相似性在潜在空间中解耦运动与外观信息,并选择性地将轨迹引导信号注入与运动相关的通道;双路径自校正引导(Dual-Path Self-Corrective Guidance) 通过比较有引导和无引导的去噪路径,自适应地纠正由噪声或结构信号错位引起的轨迹漂移。上述组件协同工作,在无需任何训练的前提下实现了细粒度且与目标轨迹对齐的引导控制,兼顾了精准的运动控制与照片级真实感内容的生成。大量跨多个基准的实验验证了本方法在视觉真实性、轨迹一致性和画面保真度方面的显著优势。本研究提出了一种全新的即插即用范式,为空间智能任务中生成先验的有效利用提供了新的视角。
8. RynnVLA-001: Using Human Demonstrations to Improve Robot Manipulation
作者: Yuming Jiang, Siteng Huang, Shengke Xue, Yaxi Zhao, Jun Cen, Sicong Leng, Kehan Li, Jiayan Guo, Kexiang Wang, Mingxiu Chen, Fan Wang, Deli Zhao, Xin Li
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-18 | 👍 点赞数: 19
摘要:
论文标题:RynnVLA-001:利用人类示范提升机器人操作能力
中文摘要:
本文提出了RynnVLA-001,一种基于大规模人类示范视频进行生成式预训练的视觉-语言-动作(Vision-Language-Action, VLA)模型。我们提出了一种新颖的两阶段预训练方法。第一阶段为“以自我为中心的视频生成式预训练”(Ego-Centric Video Generative Pretraining),在1200万条以自我为中心的操作视频上训练一个图像到视频(Image-to-Video)模型,根据初始帧和语言指令来预测未来的视频帧。第二阶段为“以人为中心的轨迹感知建模”(Human-Centric Trajectory-Aware Modeling),在此基础上进一步联合预测未来关键点的运动轨迹,从而有效连接视觉帧预测与动作预测。此外,为了增强动作表征能力,我们提出了ActionVAE——一种变分自编码器,可将动作序列压缩为紧凑的潜在嵌入表示,降低VLA模型输出空间的复杂性。在相同的下游机器人数据集上进行微调后,RynnVLA-001相较于当前最先进的基线模型表现出更优的性能,验证了所提出的预训练策略能够为VLA模型提供更有效的初始化。
9. AToken: A Unified Tokenizer for Vision
作者: Jiasen Lu, Liangchen Song, Mingze Xu, Byeongjoo Ahn, Yanjun Wang, Chen Chen, Afshin Dehghan, Yinfei Yang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-17 | 👍 点赞数: 17
摘要:
论文标题:AToken:一种面向视觉的统一 tokenizer
中文摘要:
本文提出 AToken,这是首个能够在图像、视频和 3D 资产上同时实现高保真重建与语义理解的统一视觉 tokenizer。不同于现有仅针对单一模态、且专注于重建或理解任务的 tokenizer,AToken 将多种视觉输入编码到一个共享的四维(4D)潜在空间中,从而在一个统一框架下实现了任务与模态的双重融合。具体而言,我们设计了一种纯 Transformer 架构,并引入 4D 旋转位置编码,以处理任意分辨率和时间长度的视觉输入。为确保训练稳定性,我们提出了一种无需对抗训练的目标函数,结合感知损失与 Gram 矩阵损失,在重 建质量方面达到了当前最优水平。通过采用渐进式训练策略,AToken 逐步扩展至单张图像、视频和 3D 数据,支持连续与离散两种潜在 token 表示。实验结果显示,AToken 在图像任务上取得 0.21 的 rFID 和 82.2% 的 ImageNet 准确率,在视频任务上达到 3.01 的 rFVD 和 32.6% 的 MSRVTT 检索准确率,在 3D 任务上实现 28.19 的 PSNR 和 90.9% 的分类准确率。在下游应用中,AToken 同时支持视觉生成任务(如基于连续与离散 token 的图像生成、文本到视频生成、图像到 3D 合成)和理解任务(如多模态大语言模型),在各类基准测试中均表现出具有竞争力的性能。本研究为基于统一视觉 token 化的下一代多模态人工智能系统提供了新的方向。
10. MultiEdit: Advancing Instruction-based Image Editing on Diverse and
Challenging Tasks
作者: Mingsong Li, Lin Liu, Hongjun Wang, Haoxing Chen, Xijun Gu, Shizhan Liu, Dong Gong, Junbo Zhao, Zhenzhong Lan, Jianguo Li
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-18 | 👍 点赞数: 7
摘要:
论文标题:MultiEdit:推动基于指令的图像编辑在多样化与挑战性任务上的发展
中文摘要: