每日论文 - 2025年09月14日
论文总数: 25
1. VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action
Model
作者: Yihao Wang, Pengxiang Ding, Lingxiao Li, Can Cui, Zirui Ge, Xinyang Tong, Wenxuan Song, Han Zhao, Wei Zhao, Pengxu Hou, Siteng Huang, Yifan Tang, Wenhui Wang, Ru Zhang, Jianyi Liu, Donglin Wang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-11 | 👍 点赞数: 189
摘要:
论文标题:VLA-Adapter:一种面向微型视觉-语言-动作模型的有效范式
中文摘要:
视觉-语言-动作(Vision-Language-Action, VLA)模型通常通过在机器人数据上预训练大规模视觉-语言模型(Vision-Language Model, VLM)来弥合感知空间与动作空间之间的鸿沟。尽管该方法显著提升了性能,但也带来了高昂的训练成本。本文探讨如何有效将视觉-语言(VL)表征与动作(A)空间进行连接。我们提出了VLA-Adapter,这是一种新颖的范式,旨在降低VLA模型对大规模VLM和大量预训练的依赖。为此,我们首先系统性地分析了多种视觉-语言条件的有效性,并揭示了哪些条件对于连接感知与动作空间至关重要。基于这些发现,我们设计了一个带有“桥接注意力”(Bridge Attention)机制的轻量级策略模块,能够自主地将最优条件注入到动作空间中。因此,我们的方法仅使用一个参数量为5亿(0.5B)的骨干网络,且无需任何机器人数据的预训练,即可实现高性能表现。在模拟环境和真实世界机器人基准上的大量实验表明,VLA-Adapter不仅达到了当前最先进的性能水平,而且实现了迄今报道中最快的推理速度。此外,得益于所提出的先进桥接范式,VLA-Adapter能够在单块消费级GPU上仅用8小时即可完成强大VLA模型的训练,极大降低了VLA模型部署的门槛。
项目主页:https://vla-adapter.github.io/。
2. HuMo: Human-Centric Video Generation via Collaborative Multi-Modal
Conditioning
作者: Liyang Chen, Tianxiang Ma, Jiawei Liu, Bingchuan Li, Zhuowei Chen, Lijie Liu, Xu He, Gen Li, Qian He, Zhiyong Wu
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-10 | 👍 点赞数: 120
摘要:
论文标题:HuMo:基于多模态协同控制的人本视频生成
中文摘要:
人本视频生成(Human-Centric Video Generation, HCVG)旨在根据文本、图像和音频等多种模态输入合成包含人物的视频。现有方法在有效协调这些异构模态方面面临两大挑战:一是缺乏具有成对三元组条件(文本、图像、音频)的训练数据;二是难以在多模态输入下协同完成“人物身份保持”与“音视频同步”这两个子任务。针对上述问题,本文提出 HuMo——一种统一的、支持多模态协同控制的人本视频生成框架。为应对第一个挑战,我们构建了一个高质量、多样化且包含配对文本、参考图像和音频的三模态数据集。针对第二个挑战,我们设计了一种两阶段渐进式多模态训练范式,并针对不同任务采用特定策略:在人物身份保持任务中,为了保留基础模型的文本理解与视觉生成能力,我们采用最小侵入式的图像注入策略;在音视频同步任务中,除了常规的音频交叉注意力层外,我们进一步提出“预测聚焦”策略,隐式引导模型将音频信息与面部区域相关联。在联合学习多模态可控性方面,我们在已有能力基础上逐步引入音视频同步任务,实现多任务协同训练。在推理阶段,为了实现灵活且细粒度的多模态控制,我们设计了一种时间自适应的无分类器引导(Classifier-Free Guidance)策略,能够在去噪过程中动态调整各模态的引导权重。大量实验结果表明,HuMo 在各项 子任务上均优于现有的专用最先进方法,建立了一个统一的、支持多模态协同控制的人本视频生成框架。
项目主页:https://phantom-video.github.io/HuMo。
3. SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
作者: Haozhan Li, Yuxin Zuo, Jiale Yu, Yuhao Zhang, Zhaohui Yang, Kaiyan Zhang, Xuekai Zhu, Yuchen Zhang, Tianxing Chen, Ganqu Cui, Dehui Wang, Dingxiang Luo, Yuchen Fan, Youbang Sun, Jia Zeng, Jiangmiao Pang, Shanghang Zhang, Yu Wang, Yao Mu, Bowen Zhou, Ning Ding
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-11 | 👍 点赞数: 73
摘要:
论文标题:SimpleVLA-RL:通过强化学习扩展视觉-语言-动作模型训练
中文摘要:
视觉-语言-动作(Vision-Language-Action, VLA)模型近年来已成为机器人操作领域的一种强大范式。尽管大规模预训练和监督微调(SFT)已带来显著进展,但这些模型仍面临两个根本性挑战:(i)监督微调所需的大量人类操作机器人轨迹数据稀缺且获取成本高昂;(ii)在面对分布偏移的任务时泛化能力有限。近期大型推理模型(Large Reasoning Models, LRMs)的突破表明,强化学习(Reinforcement Learning, RL)能够显著提升逐步推理能力,这引发了一个自然的问题:RL是否同样可以改善VLA模型在长视野下的逐步动作规划能力?在本研究中,我们提出了SimpleVLA-RL——一种专为VLA模型设计的高效强化学习框架。在veRL的基础上,我们引入了面向VLA的轨迹采样策略、可扩展的并行化机制、多环境渲染技术以及优化后的损失计算方法。将该方法应用于OpenVLA-OFT模型时,SimpleVLA-RL在LIBERO基准上达到了当前最优(SoTA)性能,并在RoboTwin 1.0和2.0上凭借我们提出的增强探索策略表现超越了pi_0策略。SimpleVLA-RL不仅降低了对大规模标注数据的依赖,实现了更强的泛化能力,而且在真实世界任务中的表现显著优于监督微调方法。此外,我们在RL训练过程中发现了一种新颖现象——“pushcut”,即策略能够发现此前训练阶段中从未见过的行为模式。
代码地址:https://github.com/PRIME-RL/SimpleVLA-RL
4. MachineLearningLM: Continued Pretraining Language Models on Millions of
Synthetic Tabular Prediction Tasks Scales In-Context ML
作者: Haoyu Dong, Pengkun Zhang, Mingzhe Lu, Yanzhen Shen, Guolin Ke
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-08 | 👍 点赞数: 60
摘要:
论文标题:MachineLearningLM:在数百万个合成表格预测任务上继续预训练语言模型以实现上下文内机器学习的可扩展性
中文摘要:
大型语言模型(LLMs)具备广泛的世界知识和强大的通用推理能力,但在标准机器学习(ML)任务中,它们难以通过大量上下文示例进行学习,即无法仅依靠上下文学习(ICL)而无需梯度下降来有效利用多示例示范。本文提出 MachineLearningLM,一种可移植的持续预训练框架,旨在赋予通用语言模型强大的上下文内机器学习能力,同时保留其在更广泛对话工作流中的通用知识与推理能力。
我们的预训练方法基于数百万个结构因果模型(SCMs)生成合成的机器学习任务,涵盖从少量到最多1,024个示例的多种样本规模。我们首先采用随机森林作为教师模型,将基于树的决策策略蒸馏至语言模型中,以增强其在数值建模中的鲁棒性。所有任务均采用高效令牌的提示格式进行序列化,使得每个上下文窗口可容纳3至6倍更多的示例,并通过批量推理实现高达50倍的摊销吞吐量提升。
尽管实验设置相对轻量(基于Qwen-2.5-7B-Instruct模型并使用LoRA秩8),MachineLearningLM 在金融、物理、生物和医疗等多个领域的分布外表格分类任务上,平均性能优于强基线语言模型(如 GPT-5-mini)约15%。该模型展现出显著的多示例扩展规律:随着上下文内示例数量从8增加到1,024,准确率呈现单调上升趋势。在未进行任何任务特定训练的情况下,其在数百个示例下即可达到与随机森林相当的准确水平。同时,模型保持了良好的通用对话能力,包括知识掌握 与逻辑推理,在MMLU基准上取得了75.4%的准确率。
5. EchoX: Towards Mitigating Acoustic-Semantic Gap via Echo Training for
Speech-to-Speech LLMs
作者: Yuhao Zhang, Yuhao Du, Zhanchen Dai, Xiangnan Ma, Kaiqi Kou, Benyou Wang, Haizhou Li
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-11 | 👍 点赞数: 57
摘要:
论文标题:EchoX:通过回声训练弥合语音到语音大模型中的声学-语义鸿沟
中文摘要:
语音到语音大语言模型(SLLMs)正受到越来越多的关注。由于源自基于文本的大语言模型(LLMs),SLLMs 常常在知识和推理能力方面出现退化。我们假设这一局限性源于当前 SLLMs 的训练范式未能在特征表示空间中有效弥合声学与语义之间的鸿沟。为解决此问题,我们提出了 EchoX,该方法利用语义表征并动态生成语音训练目标。该方案融合了声学与语义学习,使 EchoX 作为语音大模型仍能保持强大的推理能力。实验结果表明,EchoX 在约六千小时的训练数据下,在多个基于知识的问答基准测试上达到了先进水平。
本项目代码已公开于 https://github.com/FreedomIntelligence/EchoX。
6. Kling-Avatar: Grounding Multimodal Instructions for Cascaded
Long-Duration Avatar Animation Synthesis
作者: Yikang Ding, Jiwen Liu, Wenyuan Zhang, Zekun Wang, Wentao Hu, Liyuan Cui, Mingming Lao, Yingchao Shao, Hui Liu, Xiaohan Li, Ming Chen, Xiaoqiang Liu, Yu-Shen Liu, Pengfei Wan
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-11 | 👍 点赞数: 47
摘要:
论文标题:Kling-Avatar:面向级联长时长虚拟形象动画合成的多模态指令具身化方法
中文摘要:
近年来,音频驱动的虚拟形象视频生成技术在视听真实感方面取得了显著进展。然而,现有方法仅将指令条件视为由声学或视觉线索驱动的低层次追踪任务,未能建模指令所传达的交际意图,从而限制了其叙事连贯性与角色表现力。为弥补这一不足,我们提出了Kling-Avatar——一种新颖的级联式框架,统一了多模态指令理解与高保真肖像生成。该方法采用两阶段流程:第一阶段设计了一个多模态大语言模型(MLLM)导演模块,能够根据多样化的指令信号生成“蓝图视频”,从而控制角色动作、情绪等高层语义;第二阶段则 基于蓝图关键帧,采用首尾帧策略并行生成多个子片段。这种从全局到局部的架构在保留细粒度细节的同时,忠实编码了多模态指令背后的高层意图。此外,并行化结构支持快速且稳定的长时视频生成,适用于数字人直播、vlog等实际应用场景。为全面评估本方法性能,我们构建了一个包含375个精选样本的基准数据集,覆盖多种指令类型和具有挑战性的场景。大量实验表明,Kling-Avatar能够生成生动流畅、最高达1080p分辨率、48 fps帧率的长时视频,在唇形同步精度、情感与动态表现力、指令可控性、身份保持能力以及跨域泛化等方面均表现出优越性能。上述成果确立了Kling-Avatar作为语义具身化、高保真音频驱动虚拟形象合成的新标杆。
7. Harnessing Uncertainty: Entropy-Modulated Policy Gradients for
Long-Horizon LLM Agents
作者: Jiawei Wang, Jiacai Liu, Yuqian Fu, Yingru Li, Xintao Wang, Yuan Lin, Yu Yue, Lin Zhang, Yang Wang, Ke Wang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-11 | 👍 点赞数: 42
摘要:
论文标题:利用不确定性:基于熵调制的策略梯度方法用于长视野LLM智能体
中文摘要:
在长视 野任务中,当前基于大语言模型(Large Language Models, LLMs)的智能体面临一个重大挑战:稀疏的、基于最终结果的奖励信号难以对中间步骤进行有效的信用分配。以往的方法主要集中在构建密集的奖励信号以指导学习过程,这些方法要么采用逆向强化学习等传统强化学习技术,要么利用过程奖励模型(Process Reward Models)提供逐步反馈。本文揭示了LLM学习动态中的一个根本问题:策略梯度的幅度本质上与策略熵相关联,这导致对高置信度的正确动作更新幅度过小,而对不确定性较高的动作则可能产生过大更新,从而影响训练稳定性。为解决这一问题,我们提出了熵调制策略梯度(Entropy-Modulated Policy Gradients, EMPG),该框架根据每一步的不确定性以及最终任务结果重新校准学习信号。EMPG能够增强对高置信度正确动作的更新,惩罚高置信度下的错误行为,并抑制来自不确定步骤的更新以稳定探索过程。此外,我们引入了一个面向未来可解释性的奖励项,鼓励智能体寻找更具可预测性的解决方案路径。在WebShop、ALFWorld和Deep Search三个具有挑战性的智能体任务上进行的大量实验表明,EMPG显著优于强基线策略梯度方法,并取得了明显的性能提升。
项目主页位于 https://empgseed-seed.github.io/
8. FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning
Dataset and Comprehensive Benchmark
作者: Rongyao Fang, Aldrich Yu, Chengqi Duan, Linjiang Huang, Shuai Bai, Yuxuan Cai, Kun Wang, Si Liu, Xihui Liu, Hongsheng Li
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-11 | 👍 点赞数: 39
摘要:
论文标题:FLUX-Reason-6M 与 PRISM-Bench:百万级文本到图像推理数据集及综合基准
中文摘要:
开源文本到图像(T2I)模型的发展一直受限于缺乏大规模、以推理为核心的数据集以及全面的评估基准,导致其性能落后于领先的闭源系统。为应对这一挑战,我们提出了 FLUX-Reason-6M 和 PRISM-Bench(精确且鲁棒的图像合成测量基准)。FLUX-Reason-6M 是一个大规模数据集,包含由 FLUX 模型生成的 600 万张高质量图像和 2000 万条双语(英文和中文)描述,专为训练复杂推理能力而设计。该数据集依据六大关键特征进行组织:想象力(Imagination)、实体(Entity)、文本渲染(Text rendering)、风格(Style)、情感表达(Affection)和构图(Composition),并设计了明确的生成思维链(Generation Chain-of-Thought, GCoT),对图像生成过程提供详尽的步骤分解。整个数据构建过程耗时 15,000 个 A100 GPU 日,为学术界提供了此前仅大型工业实验室才可获得的宝贵资源。
PRISM-Bench 提出了一种全新的评估标准,包含七个不同的评测赛道,其中包括基于 GCoT 的高难度长文本生成挑战。通过精心设计的提示语,该基准利用先进的视觉-语言模型,实现对提示与图像一致性(prompt-image alignment)以及图像美学质量的细致且符合人类判断的评估。我们在 PRISM-Bench 上对 19 个主流模型进行了广泛评测,揭示了当前模型的关键性能差距,并指出了亟需改进的具体方向。我们已公开发布数据集、评测基准及代码,旨在推动下一阶段面向推理能力的文本到图像生成技术发展。 项目主页:https://flux-reason-6m.github.io/ 。
9. Can Understanding and Generation Truly Benefit Together -- or Just
Coexist?
作者: Zhiyuan Yan, Kaiqing Lin, Zongjian Li, Junyan Ye, Hui Han, Zhendong Wang, Hao Liu, Bin Lin, Hao Li, Xue Xu, Xinyan Xiao, Jingdong Wang, Haifeng Wang, Li Yuan
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-11 | 👍 点赞数: 32
摘要:
论文标题:理解与生成能否真正相互促进——还是仅仅共存?
中文摘要: 本文从自编码器(Auto-Encoder)的视角提出了一种富有洞察力的范式:将视觉理解视为编码器(I2T),将图像压缩为文本描述;将图像生成视为解码器(T2I),从该文本重建图像。通过将重建保真度作为统一的训练目标,我们强制理解与生成过程之间形成 连贯的双向信息流,从而实现两者的互利共赢。为实现这一理念,我们提出了UAE,一种用于统一多模态学习的新框架。首先,我们在大规模长上下文图像描述数据上预训练解码器,以捕捉细粒度语义和复杂的空间关系。随后,我们提出基于强化学习(RL)的Unified-GRPO方法,包含三个阶段:(1)冷启动阶段,通过语义重建损失温和地初始化编码器与解码器;(2)以生成促进理解,训练编码器生成有助于提升解码器重建质量的信息丰富描述,从而增强其视觉理解能力;(3)以理解促进生成,进一步优化解码器对这些描述的重建能力,迫使其充分利用每一个细节,提升其在长上下文指令遵循和生成保真度方面的能力。为评估模型性能,我们推出了Unified-Bench,这是首个专门用于评估统一多模态模型(UMMs)融合程度的基准。在多模态学习领域出现了一个令人惊喜的“顿悟时刻”:随着强化学习的推进,编码器自主生成出更具描述性的文本,而解码器同时展现出深刻理解这些复杂描述的能力,最终实现了极高保真度的图像重建。
10. SpatialVID: A Large-Scale Video Dataset with Spatial Annotations
作者: Jiahao Wang, Yufeng Yuan, Rujie Zheng, Youtian Lin, Jian Gao, Lin-Zhuo Chen, Yajie Bao, Yi Zhang, Chang Zeng, Yanxi Zhou, Xiaoxiao Long, Hao Zhu, Zhaoxiang Zhang, Xun Cao, Yao Yao
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-09-11 | 👍 点赞数: 28
摘要:
论文标题:SpatialVID:一种具有空间标注的大规模视频数据集
中文摘要:
在空间智能领域,无论是在空间重建还是环境探索方面,均已取得显著进展。然而,当前模型的可扩展性及真实世界中的表现力仍严重受限于大规模、高质量训练数据的匮乏。尽管已有部分数据集提供了相机位姿信息,但它们通常在规模、多样性以及标注丰富性方面存在局限,尤其是在包含真实相机运动的现实世界动态场景中更为明显。为此,我们构建了SpatialVID——一个包含大量野外真实场景视频的数据集,涵盖多样的场景、相机运动,并提供密集的三维标注,例如逐帧的相机位姿、深度图和运动指令。具体而言,我们收集了超过21,000小时的原始视频,通过分层过滤流程处理为270万个视频片段,总计达7,089小时的动态内容。随后的标注流程为这些片段补充了详尽的空间与语义信息,包括相机位姿、深度图、动态掩码、结构化字幕以及序列化的运动指令。对SpatialVID数据统计特性的分析表明,其丰富的信息和高度的多样性能够有效促进模型的泛化能力与性能提升,使其成为视频与三维视觉研究领域的重要资源。