每日论文 - 2025年09月29日
论文总数: 44
1. LongLive: Real-time Interactive Long Video Generation
作者: Shuai Yang, Wei Huang, Ruihang Chu, Yicheng Xiao, Yuyang Zhao, Xianbang Wang, Muyang Li, Enze Xie, Yingcong Chen, Yao Lu, Song Han, Yukang Chen
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 168
摘要:
论文标题:LongLive:实时交互式长视频生成
中文摘要:
本文提出 LongLive,一种面向实时交互式长视频生成的帧级自回归(AR)框架。长视频生成在效率与质量两方面均面临挑战。扩散模型(Diffusion)及扩散强制(Diffusion-Forcing)模型虽能生成高质量视频,但由于采用双向注意力机制,推理效率较低。因果注意力自回归模型支持KV缓存,可加速推理过程,但在长视频训练中因内存压力导致模型质量下降。此外,除静态提示词驱动的生成外,动态内容创作还需具备交互能力,例如流式输入提示词,使用户能够实时引导叙事发展。此类交互需求显著增加了系统复杂性,尤其是在提示词切换过程中保持视觉一致性与语义连贯性方面。为应对上述挑战,LongLive 采用因果式的帧级自回归架构,并引入三项关键技术:一是 KV重缓存机制(KV-recache),可在接收新提示时刷新缓存状态,实现平滑且贴合的生成切换;二是流式长时微调(streaming long tuning),支持长视频训练,并确保训练与推理模式一致(train-long-test-long);三是短窗口注意力结合帧级注意力锚点(frame-level attention sink,简称 frame sink),在保障长程一致性的同时提升生成速度。基于这些设计,LongLive 仅用 32 块 GPU 天即可将一个 13 亿参数的短片段模型微调至支持分钟级长视频生成。在推理阶段,LongLive 在单块 NVIDIA H100 GPU 上可达 20.7 FPS 的生成速度,在 VBench 评测中对短视频和长视频均表现出色,最高支持在单卡上生成长达 240 秒的视频。此外,LongLive 还支持 INT8 量化推理,仅带来轻微的质量损失。
2. EPO: Entropy-regularized Policy Optimization for LLM Agents
Reinforcement Learning
作者: Xu Wujiang, Wentian Zhao, Zhenting Wang, Li Yu-Jhe, Jin Can, Jin Mingyu, Mei Kai, Wan Kun, Metaxas Dimitris
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 124
摘要:
论文标题:EPO:面向大语言模型智能体的熵正则化策略优化
强化学习
中文摘要:
在稀疏奖励的多轮交互环境中训练大语言模型(LLM)智能体——其中完成单个任务需要在一个回合内进行30轮以上的交互——对强化学习构成了根本性挑战。我们识别出在此类场景下存在的一种独特失效模式:探索-利用级联失败。该级联过程始于策略的早期过早收敛,由于反馈稀疏,智能体倾向于采用有缺陷的、低熵策略;随后进入后期策略崩溃阶段,此时传统的熵正则化反而适得其反,引发混乱的探索行为,导致训练失稳。为此,我们提出熵正则化策略优化(Entropy-regularized Policy Optimization, EPO),这是一种通过三个协同机制打破该失败循环的通用框架:(1)在多轮设置中引入熵正则化以增强探索能力;(2)设计熵平滑正则项,将策略熵限制在 历史平均值范围内,防止剧烈波动;(3)采用自适应分阶段加权机制,在训练过程中动态平衡探索与利用。我们的理论分析表明,EPO能够在保证收敛的同时,确保熵方差单调递减。实验结果表明,EPO在ScienceWorld上性能提升高达152%,在ALFWorld上提升达19.8%。本研究揭示了多轮稀疏奖励场景需要与传统强化学习截然不同的熵控制机制,对大语言模型智能体的训练具有广泛意义。
3. Quantile Advantage Estimation for Entropy-Safe Reasoning
作者: Junkang Wu, Kexin Huang, Jiancan Wu, An Zhang, Xiang Wang, Xiangnan He
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 113
摘要:
论文标题:用于熵安全推理的分位数优势估计
中文摘要:
基于可验证奖励的强化学习(RLVR)能够增强大语言模型(LLM)的推理能力,但其训练过程常在“熵崩溃”与“熵爆炸”之间震荡。我们将这两种问题归因于无价值函数的强化学习方法(如GRPO和DAPO)中所使用的均值基线,该基线在奖励出现异常值时会错误地惩罚具有负优势的样本。为此,我们提出“分位数优势估计”(Quantile Advantage Estimation, QAE),将均值基线替换为按 组划分的K-分位数基线。QAE 引入了一种响应级别的双机制门控结构:在困难问题上(成功概率 p ≤ 1−K)强化稀有的成功响应,而在简单问题上(p > 1−K)则聚焦于尚未成功的失败案例。在一阶softmax更新下,我们证明了QAE具有“双向熵安全性”,即对单步熵变提供下界和上界,从而抑制熵爆炸并防止熵崩溃。实验表明,这一极简修改有效稳定了熵水平,实现了稀疏化的信用分配(通过调节K,约80%的响应获得零优势值),并在AIME 2024/2025和AMC 2023等多个基准上,持续提升了Qwen3-8B/14B-Base模型的pass@1性能。本研究结果表明,“基线设计”而非token级别的启发式方法,才是推动RLVR可扩展性的核心机制。
4. MinerU2.5: A Decoupled Vision-Language Model for Efficient
High-Resolution Document Parsing
作者: Junbo Niu, Zheng Liu, Zhuangcheng Gu, Bin Wang, Linke Ouyang, Zhiyuan Zhao, Tao Chu, Tianyao He, Fan Wu, Qintong Zhang, Zhenjiang Jin, Guang Liang, Rui Zhang, Wenzheng Zhang, Yuan Qu, Zhifei Ren, Yuefeng Sun, Yuanhong Zheng, Dongsheng Ma, Zirui Tang, Boyu Niu, Ziyang Miao, Hejun Dong, Siyi Qian, Junyuan Zhang, Jingzhou Chen, Fangdong Wang, Xiaomeng Zhao, Liqun Wei, Wei Li, Shasha Wang, Ruiliang Xu, Yuanyuan Cao, Lu Chen, Qianqian Wu, Huaiyu Gu, Lindong Lu, Keming Wang, Dechen Lin, Guanlin Shen, Xuanhe Zhou, Linfeng Zhang, Yuhang Zang, Xiaoyi Dong, Jiaqi Wang, Bo Zhang, Lei Bai, Pei Chu, Weijia Li, Jiang Wu, Lijun Wu, Zhenxiang Li, Guangyu Wang, Zhongying Tu, Chao Xu, Kai Chen, Yu Qiao, Bowen Zhou, Dahua Lin, Wentao Zhang, Conghui He
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 100
摘要:
论文标题:MinerU2.5:一种用于高效高分辨率文档解析的解耦视觉-语言模型
中文摘要:
本文提出 MinerU2.5,一个参数量为12亿的文档解析视觉-语言模型,在保持卓越计算效率的同时,实现了最先进的识别精度。我们的方法采用由粗到精的两阶段解析策略,将全局版式分析与局部内容识别进行解耦。在第一阶段,模型在降采样图像上高效执行版式分析,以识别文档中的结构化元素,从而避免直接处理高分辨率输入带来的巨大计算开销。在第二阶段,基于第一阶段获得的全局版式信息,模型对从原始图像中提取的原生分辨率局部区域进行有针对性的内容识别,有效保留密集文本、复杂公式和表格中的细粒度细节。为支持该策略,我们开发了一个综合性的数据引擎,能够生成多样化、大规模的训练语料,用于模型的预训练和微调。最终,MinerU2.5 展现出强大的文档解析能力,在多个基准测试上均达到最先进的性能,超越了通用模型和领域专用模型在各类识别任务中的表现,同时显著降低了计算资源消耗。
5. Variational Reasoning for Language Models
作者: Xiangxin Zhou, Zichen Liu, Haonan Wang, Chao Du, Min Lin, Chongxuan Li, Liang Wang, Tianyu Pang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 66
摘要:
论文标题:语言模型的变分推理
中文摘要: 我们提出了一种用于语言模型的变分推理框架,该框架将思维轨迹视为隐变量,并通过变分推断对其进行优化。从证据下界(ELBO)出发,我们将其扩展为多轨迹目标以获得更紧致的边界,并提出一种前向KL形式化方法,以稳定变分后验的训练过程。我们进一步表明,拒绝采样微调以及二元奖励的强化学习方法(包括GRPO)均可被解释为局部前向KL目标,其中模型准确率的隐式加权自然地从推导中浮现,揭示了以往未被注意到的对简单问题的偏好偏差。我们在Qwen 2.5和Qwen 3模型系列上广泛验证了该方法在多种推理任务上的有效性。总体而言,本研究提供了一个原则性的概率视角,统一了变分推断与强化学习类方法,并为提升语言模型的推理能力提供了稳定的优化目标。我们的代码可在 https://github.com/sail-sg/variational-reasoning 获取。
6. Language Models Can Learn from Verbal Feedback Without Scalar Rewards
作者: Renjie Luo, Zichen Liu, Xiangyan Liu, Chao Du, Min Lin, Wenhu Chen, Wei Lu, Tianyu Pang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 64
摘要:
论文标题:语言模型可以从言语反馈中学习而无需标量奖励
摘要:
大语言模型(LLMs)通常通过来自人类或人工智能的反馈进行强化学习训练,但这类方法通常将复杂的反馈压缩为标量奖励,从而丢失了其丰富的信息,并导致奖励尺度上的不平衡。我们提出将言语反馈视为一种条件信号。受文本到图像生成中语言先验的启发——这类先验使得模型能够根据未见过的提示生成新颖内容——我们提出了反馈条件策略(Feedback-Conditional Policy, FCP)。FCP 直接从回复-反馈对中学习,通过对离线数据进行最大似然训练,来近似反馈条件下的后验分布。我们进一步设计了一个在线自举阶段,在该阶段中,策略在正向条件下生成回复,并接收新的反馈以实现自我优化。该方法将基于反馈的学习重新定义为条件生成问题,而非奖励优化问题,为大语言模型直接从言语反馈中学习提供了一种更具表达力的途径。我们的代码可在 https://github.com/sail-sg/feedback-conditional-policy 获取。
7. ReviewScore: Misinformed Peer Review Detection with Large Language
Models
作者: Hyun Ryu, Doohyuk Jang, Hyemin S. Lee, Joonhyun Jeong, Gyeongman Kim, Donghyeon Cho, Gyouk Chu, Minyeong Hwang, Hyeongwon Jang, Changhun Kim, Haechan Kim, Jina Kim, Joowon Kim, Yoonjeon Kim, Kwanhyung Lee, Chanjae Park, Heecheol Yun, Gregor Betz, Eunho Yang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-25 | 👍 点赞数: 62
摘要:
论文标题:ReviewScore:基于大语言模型的误判型同行评审检测
中文摘要:
同行评审是学术研究的基石,但在大多数人工智能领域的会议上,随着投稿数量激增,评审质量正在下降。为了可靠地识别低质量评审,我们将“误判型评审点”定义为:评审中所指出的“缺陷”包含错误的前提,或评审中提出的“问题”已在论文中得到回答。我们验证发现,15.2%的“缺陷”和26.4%的“问题”属于误判型内容,并由此提出ReviewScore指标,用于判断一个评审点是否基于错误信息。为评估每个“缺陷”中各前提的真实性,我们设计了一种自动化引擎,能够从每条“缺陷”中重构出所有显性和隐性前提。我们构建了一个由领域专家人工标注的ReviewScore数据集,以检验大语言模型(LLMs)在自动化评估ReviewScore方面的能力。随后,我们使用当前八种最先进的大语言模型,测量其与人类在ReviewScore判断上的一致性,结果表明二者具有中等程度的一致性。我们还证明,在前提层级(premise-level)上评估真实性比在“缺陷”整体层级(weakness-level)上评估具有显著更高的一致性。深入的分歧分析进一步支持了实现ReviewScore全自动评估的可行性。
8. LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal
Training
作者: Xiang An, Yin Xie, Kaicheng Yang, Wenkang Zhang, Xiuwei Zhao, Zheng Cheng, Yirui Wang, Songcen Xu, Changrui Chen, Chunsheng Wu, Huajie Tan, Chunyuan Li, Jing Yang, Jie Yu, Xiyao Wang, Bin Qin, Yumeng Wang, Zizhen Yan, Ziyong Feng, Ziwei Liu, Bo Li, Jiankang Deng
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-28 | 👍 点赞数: 38
摘要:
论文标题:LLaVA-OneVision-1.5:面向普惠多模态训练的完全开源框架
中文摘要:
本文提出 LLaVA-OneVision-1.5,这是一种新型的大型多模态模型(LMM)系列,在显著降低计算与财务成本的同时,实现了最先进的性能。不同于现有工作,LLaVA-OneVision-1.5 提供了一个开放、高效且可复现的框架,支持从零开始完整构建 高质量的视觉-语言模型。LLaVA-OneVision-1.5 的发布包含三个核心组成部分:(1)大规模精选数据集:我们构建了一个包含 8500 万样本、概念均衡的预训练数据集 LLaVA-OneVision-1.5-Mid-Training,以及一个精心整理的 2600 万样本指令微调数据集 LLaVA-OneVision-1.5-Instruct,两者共涵盖约 640 亿个压缩后的多模态 token;(2)高效训练框架:我们开发了一套完整的端到端高效训练框架,采用离线并行数据打包策略,使得在 16,000 美元预算内即可完成 LLaVA-OneVision-1.5 的训练;(3)先进性能表现:实验结果表明,LLaVA-OneVision-1.5 在广泛的下游任务中表现出极具竞争力的性能。具体而言,LLaVA-OneVision-1.5-8B 在 27 个基准测试中的 18 个上优于 Qwen2.5-VL-7B,而 LLaVA-OneVision-1.5-4B 在全部 27 个基准上均超越 Qwen2.5-VL-3B。我们预计即将发布 LLaVA-OneVision-1.5-RL 版本,欢迎社区持续关注后续更新。
9. No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM
Reinforcement Learning via Entropy-Guided Advantage Shaping
作者: Thanh-Long V. Le, Myeongho Jeon, Kim Vu, Viet Lai, Eunho Yang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 35
摘要:
论文标题:不让任何一个提示落空:通过熵引导的优势塑造在大语言模型强化学习中挖掘零方差提示的价值
中文摘要:
基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards, RLVR)是一种提升大语言模型(Large Language Models, LLMs)推理能力的强大框架。然而,现有方法(如GRPO)仅利用那些在同一输入下模型输出结果在正确性上存在差异的问题,而忽略了所有输出均获得相同奖励的样本——即所谓的“零方差提示”。在本文中,我们认为这类提示并非无用,反而可以为策略优化提供有意义的学习反馈。为此,我们提出了“带零方差提示的强化学习”(RL-ZVP),这是一种新颖的算法,能够从零方差提示中提取学习信号。RL-ZVP 能够直接奖励正确行为、惩罚错误行为,即使在缺乏对比性响应的情况下也能实现,并结合词元级别(token-level)的特征调节反馈,以保留具有信息量且细致的信号。在六个数学推理基准上的实验表明,与 GRPO 相比,RL-ZVP 在准确率上最高提升了 8.61 个百分点,在通过率上最高提升了 7.77 个百分点,并持续优于其他过滤掉零方差提示的基线方法。这些结果凸显了在 RLVR 中利用零方差提示进行学习的巨大潜力。
10. CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement
Learning
作者: Long Xing, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, Dahua Lin
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 31
摘要:
论文标题:CapRL:通过强化学习激发密集图像描述生成能力
中文摘要:
图像描述生成是一项连接视觉与语言领域的基础性任务,在大规模视觉-语言模型(LVLMs)的预训练中发挥着关键作用。当前最先进的图像描述模型通常采用监督微调(Supervised Fine-Tuning, SFT)方式进行训练,这种范式依赖于由人类或专有模型标注的昂贵且难以扩展的数据。该方法往往导致模型过度记忆特定的真实标注答案,限制了其泛化能力以及生成多样化、创造性描述的能力。为了克服SFT的局限性,我们提出将可验证奖励强化学习(Reinforcement Learning with Verifiable Rewards, RLVR)范式应用于开放式的图像描述任务。然而,一个主要挑战在于如何为“什么是好的图像描述”这一本质上具有主观性的任务设计客观的奖励函数。为此,我们提出了图像描述强化学习框架(Captioning Reinforcement Learning, CapRL),该框架通过描述的实用性重新定义描述质量:高质量的图像描述应能使一个无需视觉输入的语言模型准确回答关于对应图像的问题。CapRL采用解耦的两阶段流程:首先由一个LVLM生成图像描述,随后基于该描述,利用一个独立的、不依赖视觉信息的纯语言模型(LLM)回答多项选择题的准确性来计算客观奖励信号。作为首个将RLVR应用于主观性图像描述任务的研究,我们证明了CapRL在多种设置下均显著提升性能。使用CapRL-3B模型标注生成的CapRL-5M描述数据集进行预训练后,在12项基准测试中均取得显著提升。此外,在Prism图像描述质量评估框架下,CapRL的表现可媲美Qwen2.5-VL-72B,平均超越基线模型8.4%。代码已公开发布:https://github.com/InternLM/CapRL。
11. PromptCoT 2.0: Scaling Prompt Synthesis for Large Language Model
Reasoning
作者: Xueliang Zhao, Wei Wu, Jian Guan, Zhuocheng Gong, Lingpeng Kong
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-24 | 👍 点赞数: 31
摘要:
论文标题:PromptCoT 2.0:面向大语言模型推理的可扩展提示合成方法
中文摘要:
大语言模型(LLMs)正从对话系统演变为强大的推理引擎,能够应对奥数竞赛和编程竞赛等复杂任务。尽管参数规模扩大和测试时计算资源的增加推动了进展,但一个关键瓶颈在于高质量训练问题的缺乏:人工构建的数据集成本高昂且数量有限,而已有的合成语料库往往过于简单或覆盖范围狭窄。PromptCoT 1.0 表明,在提示合成过程中引入推理过程(rationales)可提升问题难度。在此基础上,我们提出 PromptCoT 2.0——一种可扩展的框架,用期望最大化(Expectation-Maximization, EM)循环取代手工设计的启发式规则,通过迭代优化推理过程来指导提示的构建。该方法生成的问题在难度和多样性上均超越以往语料库。这些合成提示支持两种后训练范式:(1)自我对弈(Self-Play),即强模型在无需更强教师的情况下,通过可验证的反馈实现自主提升;(2)监督微调(Supervised Fine-Tuning, SFT),即弱模型从教师模型蒸馏出的推理轨迹中学习。大量实验验证了该方法的有效性。在自我对弈中,将 PromptCoT 2.0 应用于 Qwen3-30B-A3B-Thinking-2507 模型,在 30B 参数量级上取得了新的最先进性能,AIME 24、AIME 25 和 HMMT 25 分别提升 +4.4、+4.8 和 +5.3,LiveCodeBench v5/v6 提升 +6.1 和 +5.0,Codeforces 评分提升 +35 Elo。在监督微调中,仅使用合成提示训练 Qwen2.5-7B-Instruct 模型,其准确率即达到 73.1(AIME 24)、65.6(AIME 25)和 53.4(LiveCodeBench v5),优于使用人类标注或混合数据训练的同类模型。进一步分析证实,PromptCoT 2.0 生成的问题本质上更具挑战性,并在分布上与现有数据集显著不同。这些结果确立了提示合成为推理能力扩展的新维度,并将 PromptCoT 2.0 定位为未来开源模型可扩展推理训练的基础架构。本项目代码已公开,地址为 https://github.com/inclusionAI/PromptCoT。
12. MesaTask: Towards Task-Driven Tabletop Scene Generation via 3D Spatial
Reasoning
作者: Jinkun Hao, Naifu Liang, Zhen Luo, Xudong Xu, Weipeng Zhong, Ran Yi, Yichen Jin, Zhaoyang Lyu, Feng Zheng, Lizhuang Ma, Jiangmiao Pang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 30
摘要:
论文标题:MesaTask:通过三维空间推理实现面向任务的桌面场景生成
中文摘要:
机器人理解和执行人类指令以完成操作任务的能力,依赖于大量与任务相关的桌面场景用于训练。然而,传统构建此类场景的方法要么依赖耗时的手动布局设计,要么采用完全随机的布置,这些方法在场景合理性或与任务的匹配度方面存在局限性。本文提出了一项新任务——面向任务的桌面场景生成,该任务面临的主要挑战在于高层任务指令与具体桌面场景之间存在巨大鸿沟。为支持这一具有挑战性任务的研究,我们推出了MesaTask-10K,这是一个大规模数据集,包含约10,700个合成的桌面 场景,其布局经过人工精心设计,确保了场景的真实性和物体间复杂的相互关系。为了弥合任务与场景之间的差距,我们提出了一种“空间推理链”(Spatial Reasoning Chain),将场景生成过程分解为对象推断、空间关系推理以及最终三维布局的场景图构建三个步骤。在此基础上,我们提出了MesaTask——一种基于大语言模型(LLM)的框架,该框架利用上述推理链,并结合DPO(Direct Preference Optimization)算法进行优化,能够生成物理上合理且与给定任务描述高度一致的桌面场景。大量实验结果表明,MesaTask在生成符合任务要求且布局真实的桌面场景方面显著优于基线方法。项目主页位于 https://mesatask.github.io/
13. Fine-tuning Done Right in Model Editing
作者: Wanli Yang, Fei Sun, Rui Tang, Hongyu Zang, Du Su, Qi Cao, Jingang Wang, Huawei Shen, Xueqi Cheng
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 27
摘要:
论文标题:模型编辑中的正确微调方法
中文摘要:
微调作为适应大语言模型的基础方法,长期以来被认为在模型编辑任务中效果不佳。本文挑战了这一观点,指出此前报道 的失败并非源于微调方法本身的固有局限,而是由于将其应用于序列化的编辑任务所导致——即采用单次遍历、深度优先的流程,在处理下一个样本前将每个样本优化至收敛。尽管这种深度优先流程看似合理,但结合逐样本更新的方式会导致对每次编辑的过度优化,并引发不同编辑之间的相互干扰。我们的控制实验表明,只需将微调恢复为标准的广度优先(即基于epoch)流程,并采用小批量优化(mini-batch optimization),即可显著提升其在模型编辑中的有效性。此外,模型编辑中的微调还受到先前方法遗留下来的调参位置不当的影响。通过对调参位置进行系统分析,我们提出了LocFT-BF——一种建立在恢复后的微调框架之上的简单而高效的局部化编辑方法。在多种大语言模型和数据集上的大量实验表明,LocFT-BF大幅超越现有最先进方法。值得注意的是,据我们所知,它是首个能够在不损害模型通用能力的前提下,支持10万次编辑和720亿参数级别模型的方法,编辑规模达到此前工作的10倍以上。通过澄清一个长期存在的误解,并提出一种有理论依据的局部调参策略,我们将微调从被低估的基线方法提升为领先的模型编辑方法,为未来研究奠定了坚实基础。
14. See, Point, Fly: A Learning-Free VLM Framework for Universal Unmanned
Aerial Navigation
作者: Chih Yao Hu, Yang-Sen Lin, Yuna Lee, Chih-Hai Su, Jie-Ying Lee, Shr-Ruei Tsai, Chin-Yang Lin, Kuan-Wen Chen, Tsung-Wei Ke, Yu-Lun Liu
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 23
摘要:
论文标题:见,指,飞:一种用于通用无人机导航的无需学习的视觉-语言模型框架
中文摘要:
本文提出“见、指、飞”(See, Point, Fly,简称SPF),一种建立在视觉-语言模型(VLM)基础上、无需训练的空中视觉与语言导航(AVLN)框架。SPF能够根据任意形式的自然语言指令,在任意环境中引导无人机飞向目标。与现有基于VLM的方法将动作预测视为文本生成任务不同,我们的核心思想是将AVLN中的动作预测转化为二维空间定位(2D spatial grounding)任务。SPF利用VLM将模糊的语言指令分解为在输入图像上逐步生成的二维航点标注。结合预测的移动距离,SPF将这些二维航点转换为三维位移向量,作为无人机的控制指令。此外,SPF还能自适应地调整飞行距离,以实现更高效的导航。值得注意的是,SPF以闭环控制方式执行导航,使无人机能够在动态环境中跟踪移动目标。在深度强化学习(DRL)仿真基准测试中,SPF取得了当前最优性能,绝对性能超越此前最佳方法63%。在大量真实世界场景的实验评估中,SPF也显著优于多种强基线方法。我们还进行了全面的消融研究,验证了各项设计选择的有效性。最后,SPF展现出对不同视觉-语言模型出色的泛化能力。项目主页:https://spf-web.pages.dev
15. UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon
Scenarios
作者: Haotian Luo, Huaisong Zhang, Xuelin Zhang, Haoyu Wang, Zeyu Qin, Wenjie Lu, Guozheng Ma, Haiying He, Yingsha Xie, Qiyang Zhou, Zixuan Hu, Hongze Mi, Yibo Wang, Naiqiang Tan, Hong Chen, Yi R. Fung, Chun Yuan, Li Shen
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 23
摘要:
论文标题:UltraHorizon:超长视野场景下智能体能力的基准测试
中文摘要:
近年来,自主智能体在多个领域取得了显著进展,但现有评估大多集中于短视野、完全可观测的任务。然而,许多关键的现实世界任务——如大规模软件开发、商业投资和科学发现——通常发生在长视野且部分可观测的环境中,其成功依赖于持续的推理、规划、记忆管理以及工具使用能力。当前的基准测试很少涵盖这类长视野挑战,导致在系统性评估方面存在明显空白。为填补这一空白,我们提出了 UltraHorizon,一种新颖的基准测试框架,旨在衡量应对复杂现实任务所需的核心基础能力。我们在三个不同环境中采用“探索”作为统一任务,以验证智能体的这些关键能力。智能体被置于长视野的发现任务中,必须通过持续的推理、规划、记忆与工具管理,以及与环境的交互,逐步揭示隐藏规则。在最大规模设置下,任务轨迹平均超过20万个token,并包含400多次工具调用;即使在标准配置下,轨迹长度仍平均超过3.5万个token,涉及60余次工具调用。大量实验结果表明,基于大语言模型(LLM)的智能体在此类任务中表现持续不佳,而人类参与者则取得更高得分,凸显了智能体在长视野任务能力上的显著差距。我们还发现,简单的模型或资源扩展在此任务中效果有限。为进一步揭示智能体失败的原因,我们对收集到的任务轨迹进行了深入分析,识别出八类典型错误,并将其归因于两大根本原因:上下文锁定(in-context locking)和功能性基础能力缺失(functional fundamental capability gaps)。
https://github.com/StarDewXXX/UltraHorizon(我们的代码将在此发布。)
16. VoiceAssistant-Eval: Benchmarking AI Assistants across Listening,
Speaking, and Viewing
作者: Ke Wang, Houxing Ren, Zimu Lu, Mingjie Zhan, Hongsheng Li
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 21
摘要:
论文标题:VoiceAssistant-Eval:面向听、说、看能力的AI助手综合评测基准
中文摘要:
随着大语言模型和多模态系统能力的不断提升,以语音为核心的AI助手受到广泛关注,然而现有评测基准难以全面评估此类系统的各项能力。为此,我们提出了VoiceAssistant-Eval,一个涵盖“听”、“说”、“看”三个维度的综合性评测基准。VoiceAssistant-Eval包含10,497个精心筛选的样本,覆盖13个任务类别,涉及自然声音、音乐和口语对话等听力任务;多轮对话、角色扮演模仿及多种场景下的口语表达任务;以及高度异构的图像理解任务。为验证其有效性,我们对21个开源模型及GPT-4o-Audio进行了评估,衡量其回应内容质量、语音输出质量以及一致性表现。实验结果揭示了三个关键发现:(1)专有模型并非在所有方面均优于开源模型;(2)大多数模型在“说”的任务上表现良好,但在音频理解方面仍存在明显不足;(3)设计优良的小型模型可与更大规模的模型相媲美。值得注意的是,中等规模的Step-Audio-2-mini(7B)在听力准确率上超过LLaMA-Omni2-32B-Bilingual两倍以上。然而,当前模型仍面临挑战:多模态(音频加视觉)输入任务和角色扮演式语音模仿任务难度较高,且在鲁棒性和安全对齐方面仍存在显著差距。VoiceAssistant-Eval明确了这些短板,并为下一代AI助手的评估与发展建立了严谨的框架。代码与数据将发布于 https://mathllm.github.io/VoiceAssistantEval/ 。
17. LucidFlux: Caption-Free Universal Image Restoration via a Large-Scale
Diffusion Transformer
作者: Song Fei, Tian Ye, Lujia Wang, Lei Zhu
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 21
摘要:
论文标题:LucidFlux:基于大规模扩散Transformer的无文本提示通用图像恢复
中文摘要:
通用图像恢复(Universal Image Restoration, UIR)旨在从未知退化混合条件下恢复图像,同时保持其语义内容。在此类情况下,判别式恢复模型以及基于UNet的扩散先验方法常常出现过度平滑、产生幻觉或语义偏移等问题。本文提出LucidFlux,一种无需图像文本描述的UIR框架,能够在没有图文标注的情况下适配大规模扩散Transformer模型(Flux.1)。LucidFlux引入了一个轻量级双分支条件模块,分别从退化输入和轻度恢复的代理图像中注入信号,以锚定几何结构并抑制伪影。随后,设计了一种时间步与网络层自适应的调制策略,将这些条件信息在主干网络的层级结构中进行动态路由,实现由粗到细、上下文感知的特征更新,在保护全局结构的同时恢复纹理细节。此外,为了避免文本提示或大语言多模态模型(MLLM)生成描述所带来的延迟与不稳定性,我们通过代理图像提取SigLIP特征,实现无文本提示的语义对齐。我们还构建了一个可扩展的数据筛选流程,用于从大规模数据中筛选出结构丰富的样本以增强监督效果。在合成数据与真实场景下的多个基准测试中,LucidFlux consistently 优于现有的强开源及商业基线方法,消融实验也验证了各组件的必要性。本研究表明,对于大规模扩散Transformer而言,在真实复杂场景下实现鲁棒且无需文本提示的通用图像恢复,关键在于“何时”、“何地”以及“如何”进行条件控制——而非简单增加参数或依赖文本提示。
18. Mind-the-Glitch: Visual Correspondence for Detecting Inconsistencies in
Subject-Driven Generation
作者: Abdelrahman Eldesokey, Aleksandar Cvejic, Bernard Ghanem, Peter Wonka
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 21
摘要:
论文标题:Mind-the-Glitch:用于检测主体驱动生成中不一致性的视觉对应方法
中文摘要:
我们提出了一种新方法,可从预训练扩散模型的主干网络中解耦视觉特征与语义特征,从而实现类似于传统语义对应(semantic correspondence)的视觉对应(visual correspondence)。尽管已知扩散模型的主干网络编码了丰富的语义特征,但为了支持其图像生成能力,它们也必然包含视觉特征。然而,由于缺乏标注数据集,分离这些视觉特征具有挑战性。为此,我们设计了一个自动化流程,基于现有的主体驱动图像生成数据集,构建带有语义和视觉对应标注的图像对,并提出一种对比学习架构来分离这两类特征。利用所解耦的表征,我们进一步提出了一种新的度量指标——视觉语义匹配(Visual Semantic Matching, VSM),用于量化主体驱动图像生成中的视觉不一致性。实验结果表明,我们的方法在量化视觉不一致性方面优于CLIP、DINO以及视觉-语言模型等基于全局特征的指标,同时还能实现对不一致区域的空间定位。据我们所知,这是首个同时支持在主体驱动生成任务中进行不一致性量化与定位的方法,为主推进该领域研究提供了有力工具。项目主页:https://abdo-eldesokey.github.io/mind-the-glitch/
19. COSPADI: Compressing LLMs via Calibration-Guided Sparse Dictionary
Learning
作者: Dmitriy Shopkhoev, Denis Makhov, Magauiya Zhussip, Ammar Ali, Stamatios Lefkimmiatis
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 20
摘要:
论文标题:COSPADI:基于校准引导的稀疏字典学习的大语言模型压缩方法
中文摘要:
大语言模型(LLMs)的训练后压缩主要依赖于低秩权重近似,即通过一个共享的低维子空间来表示权重矩阵的每一列。尽管这是一种计算高效的策略,但其所施加的结构约束较为 rigid,容易导致模型精度显著下降。在本研究中,我们提出了CoSpaDi(Sparse Dictionary Learning for Compression,基于稀疏字典学习的压缩方法),一种新颖的无需训练的压缩框架,该框架用更灵活的结构化稀疏分解替代传统的低秩分解,将每个权重矩阵表示为一个稠密字典和一个列稀疏的系数矩阵。这种建模方式实现了“子空间联合”(union-of-subspaces)表示:原始权重矩阵的不同列由自适应选择的字典原子所张成的不同子空间进行逼近,相较于单一不变基底具有更强的表达能力。关键的是,CoSpaDi 利用一个小规模的校准数据集来优化分解过程,使得压缩后的投影层输出激活值尽可能接近原始模型的对应输出,从而最小化功能层面的重构误差,而不仅仅是权重本身的近似误差。这种数据感知策略在合理的压缩比率下,无需任何微调即可更好地保持模型保真度。此外,所生成的结构化稀疏性支持高效的稀疏-稠密矩阵乘法,并可与训练后量化技术兼容,进一步降低内存占用和推理延迟。我们在多种Llama和Qwen模型上,针对逐层和分组压缩设置,在20%至50%的压缩比率范围内对CoSpaDi进行了评估,结果表明其在准确率和困惑度方面均持续优于当前最先进的数据感知低秩压缩方法。我们的研 究证实,结构化稀疏字典学习是高效大语言模型部署中传统低秩方法的一种强有力替代方案。
20. WebGen-Agent: Enhancing Interactive Website Generation with Multi-Level
Feedback and Step-Level Reinforcement Learning
作者: Zimu Lu, Houxing Ren, Yunqiao Yang, Ke Wang, Zhuofan Zong, Junting Pan, Mingjie Zhan, Hongsheng Li
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 18
摘要:
论文标题:WebGen-Agent:通过多层级反馈与步骤级强化学习增强交互式网站生成
中文摘要:
基于大语言模型(LLMs)的智能体系统在仓库级代码生成任务中已展现出卓越的性能。然而,对于网站代码库生成这类高度依赖视觉效果和用户交互反馈的任务,当前的代码智能体仅依赖简单的代码执行来进行反馈与验证,这种方法难以准确反映生成代码的实际质量。本文提出 WebGen-Agent,一种新颖的网站生成智能体,能够利用全面且多层次的视觉反馈,迭代地生成并优化网站代码库。该系统通过视觉语言模型(VLM)生成针对网站截图和GUI智能体测试的详细、富有表现力的文本描述与改进建议,并提 供量化其质量的评分。这些来自截图和GUI智能体的评分进一步结合回溯与择优机制,显著提升了智能体的整体性能。得益于 WebGen-Agent 工作流程中精确的视觉评分,我们进一步提出了融合截图与GUI智能体反馈的步骤级GRPO(Step-GRPO)训练方法,以提升大语言模型作为WebGen-Agent推理引擎的能力。通过将每一步的截图与GUI智能体评分作为Step-GRPO中的奖励信号,我们提供了密集且可靠的流程监督信号,有效增强了模型的网站生成能力。在 WebGen-Bench 数据集上的实验表明,WebGen-Agent 将 Claude-3.5-Sonnet 的准确率从 26.4% 提升至 51.9%,外观质量得分从 3.0 提高到 3.9,优于此前最先进的智能体系统。此外,我们的 Step-GRPO 训练方法将 Qwen2.5-Coder-7B-Instruct 的准确率从 38.9% 提升至 45.4%,外观得分从 3.4 提升至 3.7。
21. SPARK: Synergistic Policy And Reward Co-Evolving Framework
作者: Ziyu Liu, Yuhang Zang, Shengyuan Ding, Yuhang Cao, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 16
摘要:
论文标题:SPARK:协同策略与奖励共进化框架
中文摘要:
近年来,大语言模型(LLMs)和大视觉-语言模型(LVLMs) increasingly 在预训练后阶段采用强化学习(RL)方法,例如针对客观任务的可验证奖励强化学习(RLVR),以及针对主观任务的人类反馈强化学习(RLHF)。然而,RLHF 因依赖人类偏好而成本高昂,且易导致奖励模型与策略模型之间的不匹配;而 RLVR 尽管避免了人工标注,仍会在每次更新后丢弃生成轨迹(rollouts)和正确性信号,造成监督信息的浪费。为应对上述挑战,本文提出协同策略与奖励共进化框架(Synergistic Policy And Reward Co-Evolving Framework, SPARK),这是一种高效、基于策略(on-policy)、稳定的 RLVR 增强方法。SPARK 不再丢弃生成轨迹和正确性数据,而是循环利用这些宝贵信息,将模型本身同时训练为一个生成式奖励模型。该辅助训练过程融合多种目标,包括点态奖励评分、成对比较以及基于进一步反思回应的评估,从而教会模型自我评估并改进其输出。该方法无需额外构建独立的奖励模型,也无需昂贵的人类偏好数据。SPARK 构建了一个正向的共进化反馈回路:更准确的奖励估计带来更优的策略梯度,进而产生更高质量的生成结果,反过来进一步提升奖励模型的精度。我们的统一框架支持在推理阶段通过自我反思(self-reflection)实现测试时扩展(test-time scaling),而无需依赖外部奖励模型及其开销。实验表明,SPARK 在多个 LLM 和 LVLM 模型上,于多种推理任务、奖励建模任务及通用基准测试中均取得显著性能提升。例如,SPARK-VL-7B 相较基线模型,在 7 项推理基准上平均提升 9.7%,在 2 项奖励建模范式上提升 12.1%,在 8 项通用基准上提升 1.5%,展现出优异的鲁棒性与广泛泛化能力。
22. Think-on-Graph 3.0: Efficient and Adaptive LLM Reasoning on
Heterogeneous Graphs via Multi-Agent Dual-Evolving Context Retrieval
作者: Xiaojun Wu, Cehao Yang, Xueyuan Lin, Chengjin Xu, Xuhui Jiang, Yuanliang Sun, Hui Xiong, Jia Li, Jian Guo
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 16
摘要:
论文标题:Think-on-Graph 3.0:基于多智能体双演化上下文检索的异构图高效自适应大语言模型推理
中文摘要:
检索增强生成(Retrieval-Augmented Generation, RAG)以及基于图的RAG已成为利用外部知识增强大语言模型(LLMs)的重要范式。然而,现有方法面临一个根本性的权衡问题:基于图的方法虽然依赖于高质量的图结构,但在实际应用中存在显著限制——人工构建的知识图谱难以大规模扩展且成本高昂,而从语料库中自动抽取构建的图结构则受限于底层LLM抽取器的性能,尤其是在使用规模较小、本地部署的模型时表现更差。本文提出Think-on-Graph 3.0(ToG-3),一种新颖的框架,引入了“多智能体上下文演化与检索”(Multi-Agent Context Evolution and Retrieval, MACER)机制,以克服上述局限。我们的核心创新在于动态构建并持续优化一种包含“文本块-三元组-社区”的异构图索引结构,并首次提出“查询演化”与“子图演化”的双演化机制,实现精准证据检索。该方法解决了以往基于图的RAG方法的关键缺陷——通常仅通过单次处理构建静态图索引,无法根据具体查询进行自适应调整。ToG-3采用由构造者(Constructor)、检索者(Retriever)、反思者(Reflector)和响应者(Responser)组成的多智能体系统,协同完成证据检索、答案生成、充分性反思,以及关键的查询与子图演化等迭代过程。这种双演化的多智能体架构使ToG-3能够在推理过程中自适应地构建面向特定任务的图索引,有效缓解传统静态、一次性图构建的固有弊端,即使在使用轻量级LLM的情况下也能实现深入而精确的推理。大量实验表明,ToG-3在深度与广度推理基准测试中均优于现有基线方法,消融研究也验证了MACER框架各组件的有效性。
23. Chasing the Tail: Effective Rubric-based Reward Modeling for Large
Language Model Post-Training
作者: Junkai Zhang, Zihao Wang, Lin Gui, Swarnashree Mysore Sathyendra, Jaehwan Jeong, Victor Veitch, Wei Wang, Yunzhong He, Bing Liu, Lifeng Jin
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-25 | 👍 点赞数: 16
摘要:
论文标题:追逐长尾:基于评分标准的大语言模型后训练有效奖励建模
中文摘要:
强化微调(Reinforcement Fine-Tuning, RFT)常常面临奖励过度优化的问题,即策略模型通过“操纵”奖励信号获得高分,却生成质量较低的输出。我们的理论分析表明,问题的关键在于高奖励区域的奖励误设:难以可靠地区分“优秀”回答与仅仅是“良好”的回答。这促使我们关注高奖励尾部区域。然而,在基础大语言模型(LLM)下,此类高奖励样本极为稀少。虽然可以通过离线策略获取示例(例如来自更强模型或人工重写),但直接在这些样本上训练会为待对齐的策略模型引入偏差的奖励模型。为解决这一问题,我们研究了基于评分标准(rubric-based)的奖励建模方法。评分标准的设计使其能够利用离 线策略样例,同时对这些样例中的特定偏差或伪影保持鲁棒性。为了构建能够捕捉高奖励尾部特征的评分标准,我们强调了在高质量且多样化回答之间进行精细区分的重要性,并提出了一套实现该思想的工作流程。实验结果表明,基于评分标准的奖励模型显著缓解了奖励过度优化问题,并有效提升了大语言模型后训练的效果。我们的代码可在 https://github.com/Jun-Kai-Zhang/rubrics.git 获取。
24. TUN3D: Towards Real-World Scene Understanding from Unposed Images
作者: Anton Konushin, Nikita Drozdov, Bulat Gabdullin, Alexey Zakharov, Anna Vorontsova, Danila Rukhovich, Maksim Kolodiazhnyi
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-23 | 👍 点赞数: 14
摘要:
论文标题:TUN3D:面向从无位姿图像中实现真实场景理解
中文摘要:
布局估计与三维物体检测是室内场景理解中的两项基础任务。将二者结合,能够构建出紧凑且具有丰富语义信息的场景空间表征。现有方法通常依赖点云作为输入,这带来了显著局限性,因为大多数消费级相机缺乏深度传感器,仅使用视觉数据的情况仍然更为普遍。为解决这一问题,我们提出了TUN3D——首个在真实扫描场景下、以多视角图像为输入、无需真实相机位姿或深度监督即可实现联合布局估计与三维物体检测的方法。我们的方法基于轻量级稀疏卷积主干网络,并设计了两个专用分支:一个用于三维物体检测,另一个用于布局估计,并引入了一种新颖且高效的参数化墙体表示方法。大量实验表明,TUN3D在三个具有挑战性的场景理解基准上均达到了最先进的性能:(i)使用真实点云输入,(ii)使用已知位姿的图像,以及(iii)使用未知位姿的图像。TUN3D在三维物体检测性能上可媲美专门方法的同时,在布局估计方面取得了显著提升,为整体性的室内场景理解树立了新的标杆。代码已公开发布于 https://github.com/col14m/tun3d 。
25. UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models
作者: Lan Chen, Yuchao Gu, Qi Mao
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 11