每日论文 - 2025年09月12日
论文总数: 25
1. VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action
Model
作者: Yihao Wang, Pengxiang Ding, Lingxiao Li, Can Cui, Zirui Ge, Xinyang Tong, Wenxuan Song, Han Zhao, Wei Zhao, Pengxu Hou, Siteng Huang, Yifan Tang, Wenhui Wang, Ru Zhang, Jianyi Liu, Donglin Wang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-11 | 👍 点赞数: 114
摘要:
VLA-Adapter:一种面向微型视觉-语言-动作模型的有效范式
视觉-语言-动作(Vision-Language-Action, VLA)模型通常通过对机器人数据进行大规模视觉-语言模型(Vision-Language Model, VLM)的预训练,来弥合感知空间 与动作空间之间的差距。尽管这种方法显著提升了模型性能,但也带来了高昂的训练成本。本文探讨了如何有效地将视觉-语言(VL)表征与动作(A)进行连接。我们提出了VLA-Adapter,这是一种新颖的范式,旨在降低VLA模型对大规模VLM和广泛预训练的依赖。为此,我们首先系统性地分析了多种VL条件的有效性,并揭示了哪些条件对于连接感知空间与动作空间至关重要。基于这些洞察,我们提出了一种轻量级的策略模块,结合桥接注意力机制(Bridge Attention),能够自主地将最优条件注入到动作空间中。通过这种方式,我们的方法仅使用一个参数量为0.5B的骨干网络,且无需任何机器人数据的预训练,即可实现高性能。在模拟和真实世界机器人基准任务上的大量实验表明,VLA-Adapter不仅达到了当前最先进的性能水平,还实现了迄今最快的推理速度。此外,得益于所提出的先进桥接范式,VLA-Adapter仅需单块消费级GPU即可在8小时内训练出一个强大的VLA模型,从而大幅降低了部署VLA模型的门槛。 项目页面:https://vla-adapter.github.io/。
2. HuMo: Human-Centric Video Generation via Collaborative Multi-Modal
Conditioning
作者: Liyang Chen, Tianxiang Ma, Jiawei Liu, Bingchuan Li, Zhuowei Chen, Lijie Liu, Xu He, Gen Li, Qian He, Zhiyong Wu
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-10 | 👍 点赞数: 89
摘要:
人体中心视频生成(HCVG)方法旨在从包括文本、图像和音频在内的多模态输入中合成人体视频。现有方法在协调这些异构模态方面存在困难,主要面临两个挑战:配对三元组条件的训练数据稀缺,以及难以协同完成主体保持和音视频同步这两个子任务。为此,我们提出了HuMo,一种用于协同多模态控制的统一HCVG框架。针对第一个挑战,我们构建了一个包含多样化配对文本、参考图像和音频的高质量数据集。针对第二个挑战,我们提出了一种两阶段渐进式多模态训练范式,并结合任务特定策略。在主体保持任务中,为了保持基础模型的提示跟随和视觉生成能力,我们采用了侵入性最小的图像注入策略。在音视频同步任务中,除了常用的音频交叉注意力层,我们还提出了一种“预测聚焦”策略,隐式引导模型将音频与面部区域相关联。在跨多模态输入的可控性联合学习过程中,基于此前获得的能力,我们逐步引入音视频同步任务。在推理阶段,为了实现灵活且细粒度的多模态控制,我们设计了一种时间自适应的无分类器引导(Classifier-Free Guidance)策略,动态调整去噪过程中的引导权重。大量实验结果表明,HuMo在各项子任务上均优于当前最先进的专门方法,建立了一个用于协同多模态驱动的人体中心视频生成统一框架。 项目页面:https://phantom-video.github.io/HuMo。
3. SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
作者: Haozhan Li, Yuxin Zuo, Jiale Yu, Yuhao Zhang, Zhaohui Yang, Kaiyan Zhang, Xuekai Zhu, Yuchen Zhang, Tianxing Chen, Ganqu Cui, Dehui Wang, Dingxiang Luo, Yuchen Fan, Youbang Sun, Jia Zeng, Jiangmiao Pang, Shanghang Zhang, Yu Wang, Yao Mu, Bowen Zhou, Ning Ding
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-11 | 👍 点赞数: 57
摘要:
视觉-语言-动作(Vision-Language-Action, VLA)模型最近成为机器人操作领域的一种强大范式。尽管大规模预训练和监督微调(supervised fine-tuning, SFT)推动了显著进展,但这些模型仍面临两个根本性挑战:(i)SFT扩展所需的大规模人工操作机器人轨迹稀缺且成本高昂;(ii)在涉及分布外任务的场景中泛化能力有限。近期大型推理模型(Large Reasoning Models, LRMs)的突破表明,强化学习(reinforcement learning, RL)可以显著增强逐步推理能力,这引发了一个自然问题:RL是否同样能够提升VLA模型的长视野逐步动作规划能力?本文提出了SimpleVLA-RL,一个专为VLA模型设计的高效RL框架。基于veRL,我们引入了VLA专用的轨迹采样方法、可扩展的并行化策略、多环境渲染技术以及优化后的损失计算方式。将SimpleVLA-RL 应用于OpenVLA-OFT模型时,在LIBERO任务上达到了最先进的性能,并通过我们提出的增强探索策略,在RoboTwin 1.0&2.0任务中表现超过了pi_0。SimpleVLA-RL不仅降低了对大规模数据的依赖并实现了强大的泛化能力,而且在实际任务中显著优于监督微调方法。此外,我们在RL训练过程中发现了一个新现象“pushcut”,即策略能够发现此前训练过程中未见过的模式。 Github: https://github.com/PRIME-RL/SimpleVLA-RL
4. EchoX: Towards Mitigating Acoustic-Semantic Gap via Echo Training for
Speech-to-Speech LLMs
作者: Yuhao Zhang, Yuhao Du, Zhanchen Dai, Xiangnan Ma, Kaiqi Kou, Benyou Wang, Haizhou Li
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-11 | 👍 点赞数: 52
摘要:
EchoX:通过回声训练弥合声学-语义差距的语音到语音大语言模型
语音到语音大语言模型(SLLMs)正日益受到关注。由于SLLMs源自基于文本的大语言模型(LLMs),其在知识和推理能力方面常常表现出退化。我们假设这一局限性源于当前SLLMs的训练范式无法弥合特征表示空间中的声学-语义差距。为了解决这一问题,我们提出了EchoX,该方法利用语义表示并动态生成语音训练目标。该方法融合了声学和语义学习,使EchoX作为语音LLM能够保持强大的推理能力。实验结果表明,EchoX在使用约六千小时的训练数据后,在多个基于知识的问答基准测试中表现出先进的性能。 项目代码请访问:https://github.com/FreedomIntelligence/EchoX。
5. Kling-Avatar: Grounding Multimodal Instructions for Cascaded
Long-Duration Avatar Animation Synthesis
作者: Yikang Ding, Jiwen Liu, Wenyuan Zhang, Zekun Wang, Wentao Hu, Liyuan Cui, Mingming Lao, Yingchao Shao, Hui Liu, Xiaohan Li, Ming Chen, Xiaoqiang Liu, Yu-Shen Liu, Pengfei Wan
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-11 | 👍 点赞数: 34
摘要:
近期音频驱动的虚拟形象视频生成技术在视听真实感方面取得了显著进展。然而,现有方法仅将指令条件视为由声学或视觉线索驱动的低级跟踪,未能建模指令所传达的交际意图。这一局限性影响了生成结果的叙事连贯性和角色表现力。为弥补这一差距,我们提出了Kling-Avatar,一种新颖的级联框架,将多模态指令理解与照片级真实感肖像生成统一起来。我们的方法采用两阶段流程:第一阶段设计了一个多模态大语言模型(Multimodal Large Language Model, MLLM)导演,根据多样化的指令信号生成蓝图视频,从而控制诸如角色动作和情感等高层语义;第二阶段在蓝图关键帧的引导下,采用首尾帧策略并行生成多个子片段。这种由全局到局部的框架在忠实编码多模态指令背后高层意图的同时保留了精细细节。我们的并行架构还支持长时视频的快速稳定生成,适用于数字人直播和视频博客等实际应用场景。为了全面评估我们的方法,我们构建了一个包含375个精选样本的基准测试集,覆盖多样化的指令和具有挑战性的场景。大量实验表明,Kling-Avatar能够生成最高达1080p分辨率、48帧/秒的生动流畅长时视频,在口型同步精度、情感与动态表现力、指令可控性、身份保持性以及跨域泛化能力方面均表现出卓越性能。这些成果确立了Kling-Avatar作为语义扎根、高保真音频驱动虚拟形象合成的新基准。
6. Harnessing Uncertainty: Entropy-Modulated Policy Gradients for
Long-Horizon LLM Agents
作者: Jiawei Wang, Jiacai Liu, Yuqian Fu, Yingru Li, Xintao Wang, Yuan Lin, Yu Yue, Lin Zhang, Yang Wang, Ke Wang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-11 | 👍 点赞数: 34
摘要:
在长视野任务中,基于大语言模型(Large Language Models, LLMs)的近期智能体面临一个重大挑战:稀疏的、基于结果的奖励使得难以对中间步骤进行信用分配。以往方法主要集中在构建密集的奖励信号以指导学习,这既包括使用逆强化学习等传统强化学习技术,也包括通过过程奖励模型(Process Reward Models)提供逐步反馈。本文中,我们揭示了LLMs学习动力学中的一个基本问题:策略梯度的幅度本质上与熵相关,这导致对置信正确动作的更新幅度较小,而对不确定动作的较大更新可能带来不稳定性。为了解决这一问题,我们提出了熵调制策略梯度(Entropy-Modulated Policy Gradients, EMPG)框架,该框架根据每一步的不确定性与最终任务结果重新校准学习信号。EMPG放大对置信正确动作的更新,惩罚置信错误,并抑制来自不确定步骤的更新以稳定探索过程。我们进一步引入了一个面向未来清晰度的奖励项,以鼓励智能体寻找更具可预测性的解决路径。通过对WebShop、ALFWorld和Deep Search三个具有挑战性的智能体任务进行全面实验,我们证明了EMPG实现了显著的性能提升,并明显优于强基准策略梯度方法。 项目页面:https://empgseed-seed.github.io/
7. FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning
Dataset and Comprehensive Benchmark
作者: Rongyao Fang, Aldrich Yu, Chengqi Duan, Linjiang Huang, Shuai Bai, Yuxuan Cai, Kun Wang, Si Liu, Xihui Liu, Hongsheng Li
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-11 | 👍 点赞数: 28
摘要:
FLUX-Reason-6M & PRISM-Bench: 百万级文本到图像推理数据集与综合基准
开源文本到图像(T2I)模型的发展受到缺乏大规模、以推理为中心的数据集和综合评估基准的限制,这导致其性能与领先的闭源系统之间存在差距。为应对这一挑战,我们提出了FLUX-Reason-6M和PRISM-Bench(精确且鲁棒的图像生成测量基准)。FLUX-Reason-6M是一个大规模数据集,包含600万张高质量的FLUX生成图像和2000万条双语(英文和中文)描述,专门设计用于教授复杂推理能力。图像按照六个关键特征进行组织:想象力(Imagination)、实体(Entity)、文本渲染(Text rendering)、风格(Style)、情感(Affection)和构图(Composition),并设计了明确的生成思维链(Generation Chain-of-Thought, GCoT)以提供图像生成步骤的详细分解。整个数据构建过程耗时15,000个A100 GPU日,为社区提供了此前仅大型工业实验室才能获得的资源。PRISM-Bench提供了一种新的评估标准,包含七个不同赛道,其中包括基于GCoT的长文本挑战。通过精心设计的提示,它利用先进的视觉-语言模型对提示-图像对齐性和图像美学进行细致 的人类对齐评估。我们基于PRISM-Bench对19个领先模型进行了广泛评估,揭示了关键性能差距,并突出了需要改进的具体领域。我们的数据集、基准和评估代码已公开发布,以推动下一波以推理为导向的T2I生成技术发展。 项目页面:https://flux-reason-6m.github.io/。
8. Can Understanding and Generation Truly Benefit Together -- or Just
Coexist?
作者: Zhiyuan Yan, Kaiqing Lin, Zongjian Li, Junyan Ye, Hui Han, Zhendong Wang, Hao Liu, Bin Lin, Hao Li, Xue Xu, Xinyan Xiao, Jingdong Wang, Haifeng Wang, Li Yuan
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-11 | 👍 点赞数: 25
摘要:
在本文中,我们通过自编码器(Auto-Encoder)的视角引入了一种富有洞察力的范式——将理解(I2T)视为编码器过程,将图像压缩为文本,而将生成(T2I)视为解码器过程,从该文本重建图像。以重建保真度作为统一的训练目标,我们强制理解与生成过程之间的连贯双向信息流,从而实现两者的相互增益。为实现这一目标,我们提出了UAE,这是一种用于统一多模态学习(UMM)的全新框架。我们首先利用大规模长上下文图像描述对解码器进行预训练,以捕捉细粒度语义和复杂的空间关系。随后,我们通过强化学习(RL)提出Unified-GRPO,其包含三个阶段:(1)冷启动阶段,通过语义重建损失温和地初始化编码器和解码器;(2)生成促进理解阶段,其中编码器被训练以生成能够最大化解码器重建质量的信息性描述,从而增强其视觉理解能力;(3)理解促进生成阶段,其中解码器被进一步优化,以从这些描述中重建图像,迫使其利用每一个细节,提升其长上下文指令遵循能力和生成保真度。在评估方面,我们引入了Unified-Bench,这是首个专门用于评估UMMs统一程度的基准测试。在强化学习过程中,我们观察到多模态学习领域的一个令人惊讶的“顿悟时刻”:随着训练的推进,编码器自主生成更具描述性的描述,而解码器则同时展现出深刻理解这些复杂描述的能力,从而实现了极高保真度的图像重建。
9. MachineLearningLM: Continued Pretraining Language Models on Millions of
Synthetic Tabular Prediction Tasks Scales In-Context ML
作者: Haoyu Dong, Pengkun Zhang, Mingzhe Lu, Yanzhen Shen, Guolin Ke
链接: 📄 ArXiv |