每日论文 - 2025年09月30日
论文总数: 82
1. SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable
Sparse-Linear Attention
作者: Jintao Zhang, Haoxu Wang, Kai Jiang, Shuo Yang, Kaiwen Zheng, Haocheng Xi, Ziteng Wang, Hongzhou Zhu, Min Zhao, Ion Stoica, Joseph E. Gonzalez, Jun Zhu, Jianfei Chen
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-28 | 👍 点赞数: 108
摘要:
论文标题:SLA:通过可微调稀疏线性注意力超越扩散变 换器中的稀疏性
中文摘要:
在扩散变换器(Diffusion Transformer, DiT)模型中,尤其是视频生成任务中,由于序列长度较长以及注意力机制的二次复杂度,注意力计算延迟成为主要瓶颈。我们发现,注意力权重可以自然地分为两部分:一小部分具有高秩的大权重,以及其余低秩的小权重。这一观察表明,可以对前者采用稀疏加速,对后者采用低秩加速。基于此,我们提出了SLA(Sparse-Linear Attention,稀疏线性注意力),一种可训练的注意力方法,融合了稀疏注意力与线性注意力,以加速扩散模型。SLA将注意力权重划分为关键、边缘和可忽略三类,分别对关键权重应用O(N²)复杂度的注意力计算,对边缘权重应用O(N)复杂度的计算,而跳过可忽略的权重。SLA将这些计算整合到一个统一的GPU内核中,并支持前向和反向传播。仅需少量使用SLA的微调步骤,DiT模型即可实现注意力计算量减少20倍,显著提升推理速度,且不损失生成质量。实验表明,SLA在端到端生成质量无损的情况下,将注意力计算量减少了95%,性能优于基线方法。此外,我们实现了高效的SLA专用GPU内核,在Wan2.1-1.3B模型上的视频生成任务中,注意力计算速度提升了13.7倍,端到端速度提升了2.2倍。
2. StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient
SpeechLLMs
作者: Yuhan Song, Linhao Zhang, Chuhan Wu, Aiwei Liu, Wei Jia, Houfeng Wang, Xiao Zhou
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 62
摘要:
论文标题:StableToken:一种面向鲁棒语音大语言模型的抗噪声语义语音分词器
中文摘要:
当前主流的语义语音分词器虽旨在捕捉语言内容,却表现出惊人的脆弱性。我们发现,这些分词器对不改变语义的声学扰动缺乏鲁棒性;即使在信噪比(SNR)较高的情况下——此时语音完全可懂——其输出的分词序列仍可能发生剧烈变化,从而加重下游大语言模型的学习负担。这种不稳定性源于两个缺陷:一是采用脆弱的单路径量化架构,二是训练信号远离中间分词结果的稳定性需求。为解决这一问题,我们提出 StableToken,一种通过共识驱动机制实现稳定性的语音分词器。该分词器采用多分支并行处理音频的架构,并通过强大的逐比特投票机制融合各分支表征,生成单一且稳定的分词序列。StableToken 在分词稳定性方面达到了新的最先进水平,在多种噪声条件下显著降低了单元编辑距离(Unit Edit Distance, UED)。这种基础性的稳定性直接转化为下游任务的优势,显著提升了语音大语言模型(SpeechLLMs)在多项任务中的鲁棒性。
3. Multiplayer Nash Preference Optimization
作者: Fang Wu, Xu Huang, Weihao Xuan, Zhiwei Zhang, Yijia Xiao, Guancheng Wan, Xiaomin Li, Bing Hu, Peng Xia, Jure Leskovec, Yejin Choi
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-27 | 👍 点赞数: 60
摘要:
论文标题:多玩家纳什偏好优化
摘要:
基于人类反馈的强化学习(RLHF)已成为将大语言模型(LLMs)与人类偏好对齐的标准范式。然而,建立在Bradley-Terry假设基础上的基于奖励的方法难以捕捉现实世界偏好中普遍存在的非传递性和异质性特征。为解决这一问题,近期研究将对齐过程重新建模为一个双人纳什博弈,从而提出了基于人类反馈的纳什学习(NLHF)。尽管这一视角催生了INPO、ONPO和EGPO等具有较强理论与实证保障的算法,但这些方法仍局限于双人交互框架,导致存在单一对手偏差,无法充分反映真实偏好结构的复杂性。本文提出多玩家纳什偏好优化(MNPO),一种将NLHF推广至多玩家场景的全新框架。该框架将对齐问题建模为一个n人博弈,其中每个策略在与一组对手策略竞争的同时,受到向参考模型正则化的约束。我们的方法在多玩家设定下建立了定义良好的纳什均衡,并扩展了对偶间隙(duality gap)的概念以量化近似解的质量。我们证明,MNPO继承了双人博弈方法的均衡保证,同时支持更丰富的竞争动态,能够更好地覆盖多样化的偏好结构。通过全面的实验评估,我们在指令遵循基准任务上验证了MNPO始终优于现有的NLHF基线方法,在标注者异质性条件以及混合策略评估场景下均展现出更优的对齐性能。综上所述,本研究确立了MNPO作为一种原理严谨且可扩展的框架,适用于将大语言模型与复杂、非传递的人类偏好进行对齐。代码地址:https://github.com/smiles724/MNPO。
4. OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation
and Editing
作者: Zhihong Chen, Xuehai Bai, Yang Shi, Chaoyou Fu, Huanyu Zhang, Haotian Wang, Xiaoyan Sun, Zhang Zhang, Liang Wang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-29 | 👍 点赞数: 48
摘要:
论文标题:OpenGPT-4o-Image:面向高级图像生成与编辑的综合性数据集
中文摘要:
统一的多模态模型在图像生成与编辑任务上的性能,从根本上受限于其训练数据的质量和全面性。尽管现有数据集已涵盖风格迁移和简单物体操作等基础任务,但往往缺乏面向实际应用所需的系统性结构和具有挑战性的场景。为解决这一瓶颈问题,我们提出了OpenGPT-4o-Image——一个采用新颖方法构建的大规模数据集,该方法结合了分层任务分类体系 与自动化数据生成流程。我们的分类体系不仅包含文本渲染、风格控制等基础能力,还引入了若干高度实用但极具挑战性的类别,例如用于化学图示的科学图像生成,以及需要同时执行多个操作的复杂指令编辑任务。通过利用结构化资源库和GPT-4o构建的自动化流水线,我们生成了8万组高质量的指令-图像配对数据,覆盖11个主要领域和51个子任务,且具备可控的多样性。大量实验表明,在本数据集上对先进模型进行微调后,在多个基准测试中均取得显著性能提升:在图像编辑任务上最高提升达18%(UniWorld-V1在ImgEdit-Bench上的表现),在图像生成任务上提升达13%(Harmon在GenEval上的表现)。本研究证明,系统化的数据构建是推动多模态人工智能能力进步的关键。
5. Beyond the Exploration-Exploitation Trade-off: A Hidden State Approach
for LLM Reasoning in RLVR
作者: Fanding Huang, Guanbo Huang, Xiao Fan, Yi He, Xiao Liang, Xiao Chen, Qinting Jiang, Faisal Nadeem Khan, Jingyan Jiang, Zhi Wang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-28 | 👍 点赞数: 46
摘要:
论文标题:超越探索与利用的权衡:一 种面向大语言模型在可验证奖励强化学习中推理的隐状态方法
中文摘要:
在可验证奖励强化学习(RLVR)领域,主流观点常从“探索-利用权衡”的视角来理解近期进展,这一观点主要受到词元(token)层级指标的影响。我们重新审视这一视角,提出这种看似存在的权衡可能并非根本性约束,而更多是测量层级带来的产物。为深入探究此问题,我们将分析转向语义更丰富的隐状态空间,采用有效秩(Effective Rank, ER)来量化探索程度,并提出其新颖的一阶和二阶导数——有效秩速度(Effective Rank Velocity, ERV)与有效秩加速度(Effective Rank Acceleration, ERA),用于刻画利用动态。我们的分析表明,在隐状态层面,探索与利用可以实现解耦(见第4节)。这一发现揭示了同时提升两者能力的新机遇。基于此洞见,我们提出了速度驱动的秩学习方法(Velocity-Exploiting Rank-Learning, VERL),这是首个通过直接塑造强化学习中的优势函数来实现探索与利用协同增强的方法。其核心创新在于利用理论上稳定的ERA作为预测性元控制器,构建一种协同式的双通道激励结构。VERL不再强制进行权衡,而是前瞻性地放大探索带来的奖励以防止过度自信,同时强化利用性收益以巩固推理成果。在多种大语言模型和推理基准上的实验结果均显示出持续提升的效果,其中在具有挑战性的Gaokao 2024数据集上绝对准确率最高提升了21.4%。
6. RealUnify: Do Unified Models Truly Benefit from Unification? A
Comprehensive Benchmark
作者: Yang Shi, Yuhao Dong, Yue Ding, Yuran Wang, Xuanyu Zhu, Sheng Zhou, Wenting Liu, Haochen Tian, Rundong Wang, Huanqian Wang, Zuyan Liu, Bohan Zeng, Ruizhe Chen, Qixun Wang, Zhuoran Zhang, Xinlong Chen, Chengzhuo Tong, Bozhou Li, Chaoyou Fu, Qiang Liu, Haotian Wang, Wenjing Yang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang, Ziwei Liu
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-29 | 👍 点赞数: 44
摘要:
论文标题:RealUnify:统一模型真的能从统一中受益吗?一项全面的基准研究
中文摘要:
将视觉理解与生成能力整合到统一的多模态模型中,是迈向通用人工智能的重要一步。然而,现有基准尚未回答一个根本性问题:这种架构上的统一是否真正实现了不同能力之间的协同交互?当前的评估范式主要孤立地评估理解与生成能力,难以判断统一模型是否能够利用其理解能力来提升生成质量,或通过生成模拟来促进更深层次的理解。为填补这一关键空白,我们提出了RealUnify——一个专门用于评估双向能力协同性的基准。RealUnify包含10个类别、32项子任务,共1,000个人工精心标注的实例。该基准围绕两个核心维度构建:1)理解增强生成,要求通过推理(如常识、逻辑)来指导图像生成;2)生成增强理解,要求通过心理模拟或重构(例如对变换或混乱视觉输入的重建)来完成推理任务。本研究的一项重要贡献是提出了一种双阶段评估协议,结合了端到端的直接评估与诊断性的分步评估,后者 将任务分解为独立的理解和生成阶段。该协议使我们能够精确识别性能瓶颈究竟源于核心能力的不足,还是能力间整合失败。通过对12种主流统一模型和6种专用基线模型的大规模评估,我们发现当前的统一模型在实现有效协同方面仍面临显著挑战,表明仅靠架构上的统一是不够的。这些结果凸显了亟需新的训练策略和归纳偏置,以充分释放统一建模范式的潜力。
7. SANA-Video: Efficient Video Generation with Block Linear Diffusion
Transformer
作者: Junsong Chen, Yuyang Zhao, Jincheng Yu, Ruihang Chu, Junyu Chen, Shuai Yang, Xianbang Wang, Yicheng Pan, Daquan Zhou, Huan Ling, Haozhe Liu, Hongwei Yi, Hao Zhang, Muyang Li, Yukang Chen, Han Cai, Sanja Fidler, Ping Luo, Song Han, Enze Xie
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-29 | 👍 点赞数: 37
摘要:
论文标题:SANA-Video:基于块线性扩散Transformer的高效视频生成
中文摘要:
我们提出了SANA-Video,一种小型扩散模型,能够高效生成分辨率高达720×1280、时长达到一分钟的视频。SANA-Video可在极快速度下合成高分辨率、高质量且文本与视频高度对齐的长时视频,并可部署于RTX 5090 GPU上。两项核心技术设计保障了我们高效、有效且支持长时视频生成的能力:(1)线性DiT(Linear DiT):我们采用线性注意力机制作为核心运算模块,在处理视频生成中大量token的情况下,相比传统注意力机制具有更高的计算效率;(2)用于块线性注意力的恒定内存KV缓存:通过利用线性注意力的累积特性,我们设计了一种按块自回归的方法,引入固定内存开销的状态表示。该KV缓存以恒定内存成本为线性DiT提供全局上下文信息,无需传统的KV缓存机制,从而实现高效的一分钟级长视频生成。此外,我们探索了有效的数据过滤方法和模型训练策略,将训练成本压缩至64块H100 GPU上仅需12天,仅为MovieGen训练成本的1%。在如此低的训练成本下,SANA-Video在性能上仍可与当前最先进的小型扩散模型(如Wan 2.1-1.3B和SkyReel-V2-1.3B)相媲美,且实测延迟速度快16倍。同时,SANA-Video可在RTX 5090 GPU上以NVFP4精度进行部署,将生成一段5秒720p视频的推理时间从71秒缩短至29秒,实现2.4倍加速。综上所述,SANA-Video实现了低成本、高质量的视频生成。
8. Democratizing AI scientists using ToolUniverse
作者: Shanghua Gao, Richard Zhu, Pengwei Sui, Zhenglun Kong, Sufian Aldogom, Yepeng Huang, Ayush Noori, Reza Shamji, Krishna Parvataneni, Theodoros Tsiligkaridis, Marinka Zitnik
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-27 | 👍 点赞数: 36
摘要:
论文标题:利用ToolUniverse实现AI科学家的普及化
中文摘要:
AI科学家是一类新兴的计算系统,可作为科研发现中的协作伙伴。然而,这类系统的构建仍然面临挑战,原因在于它们通常是定制化的,依赖于固定的流程,且缺乏能够将工具、数据和分析方法整合到统一生态系统中的共享环境。在组学(omics)领域,统一的生态系统通过实现互操作性、可重用性以及社区驱动的开发,已彻底改变了研究范式;而AI科学家的发展同样需要类似的基础设施。本文提出了ToolUniverse——一个支持使用任意编程语言或推理模型(无论是开源还是闭源)构建AI科学家的生态系统。ToolUniverse标准化了AI科学家识别和调用工具的方式,集成了超过600个用于数据分析、知识检索和实验设计的机器学习模型、数据集、API及科学计算软件包。该系统能够自动优化工具接口以确保AI科学家正确使用,可根据自然语言描述生成新工具,迭代优化工具规范,并将多个工具组合成具备自主能力的工作流。在一项关于高胆固醇血症的案例研究中,研究人员利用ToolUniverse构建了一位AI科学家,成功识别出一种具有良好预测性质的强效药物类似物。开源版的ToolUniverse可在 https://aiscientist.tools 获取。
9. When Does Reasoning Matter? A Controlled Study of Reasoning's
Contribution to Model Performance
作者: Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Kevin El-Haddad, Céline Hudelot, Pierre Colombo
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-26 | 👍 点赞数: 35
摘要:
论文标题:推理在何时重要?对推理能力在模型性能中作用的控制性研究
中文摘要:
具备推理能力的大语言模型(LLMs)已在多种任务上取得了最先进的性能。尽管推理方法在实证上取得了成功,但其在哪些任务和模型规模下才真正有效,以及相关的训练与推理成本,仍有待深入探索。在本研究中,我们基于一种合成数据蒸馏框架,开展了一项大规模的有监督研究。我们在多种以数学为核心及通用型任务上,对比了不同规模的指令微调(Instruction Fine-Tuning, IFT)模型与推理模型,并评估了多项选择题和开放式生成两种形式的表现。我们的分析表明,推理能力始终能持续提升模型性能,往往能够达到甚至超过规模显著更大的IFT系统的性能。值得注意的是,尽管IFT在训练和推理成本方面仍保持帕累托最优,但随着模型规模的扩大,推理模型的价值日益凸显,能够在推理密集型和开放式任务上突破IFT的性能瓶颈。
10. Visual Jigsaw Post-Training Improves MLLMs
作者: Penghao Wu, Yushan Zhang, Haiwen Diao, Bo Li, Lewei Lu, Ziwei Liu
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-29 | 👍 点赞数: 34
摘要:
论文标题:视觉拼图后训练提升多模态大语言模型性能
中文摘要:
基于强化学习的后训练方法最近成为增强多模态大语言模型(MLLMs)对齐能力与推理能力的一种强大范式。尽管以视觉为中心的后训练对于提升MLLMs对视觉信号的内在理解至关重要,但当前的后训练范式主要以文本为中心,仅利用密集的视觉输入提取稀疏线索用于基于文本的推理。虽已有少数研究朝此方向探索,但这些方法通常仍依赖文本作为中间媒介,或引入额外的视觉生成模块。在本研究中,我们提出了Visual Jigsaw——一种通用的自监督后训练框架,旨在增强MLLMs的视觉理解能力。Visual Jigsaw被构建成一个通用的排序任务:将视觉输入分割后打乱顺序,要求模型通过生成正确的排列顺序描述来重建原始视觉信息。该任务自然契合可验证奖励下的强化学习(RLVR),无需引入额外的视觉生成组件,并且能够在无任何人工标注的情况下自动获得监督信号。我们在图像、视频和3D数据三种视觉模态上实现了Visual Jigsaw的具体应用。大量实验表明,该方法在细粒度感知、时序推理以及三维空间理解方面均带来显著提升。我们的研究结果凸显了自监 督、以视觉为中心的任务在MLLMs后训练中的潜力,并期望激发更多关于视觉中心型预训练任务设计的后续研究。项目主页:https://penghao-wu.github.io/visual_jigsaw/
11. Sequential Diffusion Language Models
作者: Yangzhou Liu, Yue Cao, Hao Li, Gen Luo, Zhe Chen, Weiyun Wang, Xiaobo Liang, Biqing Qi, Lijun Wu, Changyao Tian, Yanting Zhang, Yuqiang Li, Tong Lu, Yu Qiao, Jifeng Dai, Wenhai Wang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-28 | 👍 点赞数: 34
摘要:
论文标题:序列扩散语言模型
中文摘要: 扩散语言模型(Diffusion Language Models, DLMs)具有较强的理论效率,但受限于固定长度的解码过程以及与键值(KV)缓存机制的不兼容性。块扩散(Block diffusion)方法在一定程度上缓解了这些问题,但仍强制使用固定的块大小,且需要昂贵的训练成本。本文提出“下一段序列预测”(Next Sequence Prediction, NSP),该方法统一了下一个词元(next-token)和下一块序列(next-block)的预测任务,使模型能够在每一步自适应地决定生成序列的长度。当生成长度固定为1时,NSP退化为标准的下一词元预测。基于NSP,我们进一步提出序列扩散 语言模型(Sequential Diffusion Language Model, SDLM),该模型能够以极低的成本改造预训练的自回归语言模型(Autoregressive Language Models, ALMs)。具体而言,SDLM在固定大小的掩码块内执行扩散推理,但根据模型的置信度动态解码连续的子序列,从而保持与KV缓存的兼容性,并提升对序列中不同位置不确定性与语义变化的鲁棒性。实验表明,SDLM仅使用350万训练样本即可达到或超越强自回归基线模型的性能,同时吞吐量较Qwen-2.5高出2.1倍。值得注意的是,SDLM-32B模型展现出更为显著的效率优势,验证了所提建模范式的良好可扩展性。项目主页与代码地址:https://github.com/OpenGVLab/SDLM
12. SparseD: Sparse Attention for Diffusion Language Models
作者: Zeqing Wang, Gongfan Fang, Xinyin Ma, Xingyi Yang, Xinchao Wang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-28 | 👍 点赞数: 29
摘要:
论文标题:SparseD:面向扩散语言模型的稀疏注意力机制
中文摘要:
尽管扩散语言模型(DLMs)为自回归模型(ARs)提供了一种颇具前景的替代方案,但现有的开源DLMs在推理过程中存在较高的延迟问题。这一瓶颈主要源于注意力机制在计算所有查询-键值对时,其复杂度随上下文长度呈二次增长。直观上,为了降低该复杂度,一种自然的策略是将注意力限制在仅保留最相关连接的稀疏模式中。这类方法在自回归模型中已有成熟应用,其中注意力遵循固定且明确定义的稀疏模式。然而,在DLMs中,我们观察到显著不同的稀疏特性:(1)注意力模式在不同注意力头之间存在差异;(2)每个注意力头内的模式在去噪的各个步骤中高度相似;(3)早期去噪步骤对生成质量至关重要。这些发现使得专为ARs设计的稀疏注意力方法难以适用于DLMs——它们无法捕捉头特定的结构特征,并且在早期去噪步骤中应用时可能损害生成效果。为应对这些挑战,我们提出了SparseD,一种面向DLMs的新型稀疏注意力方法。基于上述观察,SparseD仅需预先一次性计算各注意力头特有的稀疏模式,并在所有去噪步骤中重复使用,从而避免了每一步都重新计算稀疏结构。同时,SparseD在早期去噪阶段采用完整注意力以保障生成质量,随后切换至稀疏注意力以提升效率。上述设计使SparseD成为在长上下文应用场景中部署DLMs的一种高效且实用的解决方案。实验结果表明,SparseD实现了无损加速,在64k上下文长度和1,024步去噪的设置下,相比FlashAttention最高可达1.50倍的加速效果。