每日论文 - 2025年08月27日
论文总数: 27
1. VibeVoice Technical Report
作者: Zhiliang Peng, Jianwei Yu, Wenhui Wang, Yaoyao Chang, Yutao Sun, Li Dong, Yi Zhu, Weijiang Xu, Hangbo Bao, Zehua Wang, Shaohan Huang, Yan Xia, Furu Wei
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-26 | 👍 点赞数: 90
摘要:
本文介绍了VibeVoice,这是一种新颖的模型,旨在通过使用next-token diffusion(一种通过扩散过程自回归生成潜在向量来建模连续数据的统一方法),合成包含多个说话人的长段语音。为此,我们引入了一种新的连续语音分词器(tokenizer),与流行的Encodec模型相比,其在保持性能相当的情况下将数据压缩率提高了80倍。该分词 器在有效保持音频保真度的同时,显著提升了处理长序列的计算效率。因此,VibeVoice可以在最长90分钟(上下文窗口长度为64K)的对话中支持最多4个说话人,生成具有真实对话“氛围(vibe)”的语音,并超越现有的开源与专有对话模型。
2. TreePO: Bridging the Gap of Policy Optimization and Efficacy and
Inference Efficiency with Heuristic Tree-based Modeling
作者: Yizhi Li, Qingshui Gu, Zhoufutu Wen, Ziniu Li, Tianshun Xing, Shuyue Guo, Tianyu Zheng, Xin Zhou, Xingwei Qu, Wangchunshu Zhou, Zheng Zhang, Wei Shen, Qian Liu, Chenghua Lin, Jian Yang, Ge Zhang, Wenhao Huang
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-24 | 👍 点赞数: 70
摘要:
摘要:
通过强化学习对齐大语言模型的最新进展在解决复杂推理问题方面取得了显著成效,但往往伴随着高昂的策略 rollout 成本以及对多样化推理路径的探索受限。本文提出了 TreePO,一种自引导 rollout 算法,将序列生成视为树状搜索过程。TreePO 由动态树采样策略和固定长度分段解码构成,利用局部不确定性生成额外分支。通过在公共前缀上分摊计算量并提前剪枝低价值路径,TreePO 实质上降低了每次更新的计算负担,同时保持或增强了探索的多样性。主要贡献包括:(1) 一种分段采样算法,通过连续分段缓解 KV 缓存压力,并结合早停机制生成新分支;(2) 一种基于树结构的分段级优势估计方法,同时考虑全局和局部邻近策略优化;(3) 对概率和质量驱动的动态发散与回退策略有效性的分析。我们在一系列推理基准上验证了 TreePO 的性能提升,并在采样设计中实现了从 22% 到 43% 的 GPU 小时效率提升,同时对于现有模型,在轨迹级别和 token 级别的采样计算上分别实现了最高 40% 和 35% 的减少。TreePO 在提供推理效率“免费午餐”的同时,为基于更少样本和更少计算资源的强化学习后训练规模化提供了可行路径。项目主页位于 https://m-a-p.ai/TreePO。
3. CMPhysBench: A Benchmark for Evaluating Large Language Models in
Condensed Matter Physics
作者: Weida Wang, Dongchen Huang, Jiatong Li, Tengchao Yang, Ziyang Zheng, Di Zhang, Dong Han, Benteng Chen, Binzhao Luo, Zhiyu Liu, Kunling Liu, Zhiyuan Gao, Shiqi Geng, Wei Ma, Jiaming Su, Xin Li, Shuchen Pu, Yuhan Shui, Qianjia Cheng, Zhihao Dou, Dongfei Cui, Changyong He, Jin Zeng, Zeke Xie, Mao Su, Dongzhan Zhou, Yuqiang Li, Wanli Ouyang, Yunqi Cai, Xi Dai, Shufei Zhang, Lei Bai, Jinguang Cheng, Zhong Fang, Hongming Weng
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-25 | 👍 点赞数: 45
摘要:
我们推出了CMPhysBench,这是一个用于评估大语言模型(LLMs)在凝聚态物理领域表现的新基准。CMPhysBench 包含超过520道精心筛选的研究生水平问题,覆盖凝聚态物理的代表性子领域和基础理论框架,如磁性、超导性、强关联体系等。为深入理解问题求解过程,我们专注于计算类问题,要求LLMs独立生成完整的解题过程。同时,借助基于表达式的树状结构表示,我们引入了可扩展表达式编辑距离(Scalable Expression Edit Distance, SEED)评分,提供细粒度(非二元)的部分得分,从而更精确地评估预测结果与真实答案之间的相似性。实验结果显示,即使是表现最好的模型Grok-4,在CMPhysBench上的平均SEED得分仅为36,准确率仅为28%,突显了当前LLMs在这一实用且前沿的物理领域与传统物理相比仍存在显著的能力差距。代码和数据集已公开在https://github.com/CMPhysBench/CMPhysBench。
4. VoxHammer: Training-Free Precise and Coherent 3D Editing in Native 3D
Space
作者: Lin Li, Zehuan Huang, Haoran Feng, Gengxiong Zhuang, Rui Chen, Chunchao Guo, Lu Sheng
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-26 | 👍 点赞数: 35
摘要:
VoxHammer: 原生3D空间中无需训练的精确且连贯的3D编辑方法
指定区域的3D局部编辑对于游戏产业和机器人交互至关重要。近期方法通常通过编辑渲染后的多视角图像再重建3D模型,但难以精确保留未编辑区域并保持整体一致性。受结构化3D生成模型的启发,我们提出了一种全新的无需训练的方法VoxHammer,可在3D潜在空间中实现精确且连贯的编辑。对于给定的3D模型,VoxHammer首先预测其反演轨迹,并在每个时间步获取其反演潜在表示以及对应的键值(token)。随后在去噪与编辑阶段,我们以相应反演潜在表示和缓存的键值(token)替换保留区域的去噪特征。通过保留这些上下文特征,该方法确保了保留区域的一致性重建以及编辑部分的连贯融合。为了评估保留区域的一致性,我们构建了Edit3D-Bench,这是一个由数百个样本组成的人工标注数据集,每个样本均包含精细标注的3D编辑区域。实验表明,VoxHammer在保留区域的3D一致性及整体编辑质量方面显著优于现有方法。我们的方法有望合成高质量的编辑配对数据,从而为上下文内3D生成奠定数据基础。项目页面详见https://huanngzh.github.io/VoxHammer-Page/。
5. OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive
Simulation
作者: Jianwen Jiang, Weihong Zeng, Zerong Zheng, Jiaqi Yang, Chao Liang, Wang Liao, Han Liang, Yuan Zhang, Mingyuan Gao
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-26 | 👍 点赞数: 35
摘要:
现有视频虚拟人模型虽能生成流畅的人类动画,但往往难以超越单纯的物理相似性以捕捉角色的真实本质。其动作通常仅与音频节奏等低级线索同步,缺乏对情感、意图或上下文的深层语义理解。为弥合这一差距,我们提出了一种框架,旨在生成不仅物理上合理,而且语义连贯且富有表现力的角色动画。我们的模型OmniHuman-1.5基于两项关键技术贡献。首先,我们利用多模态大语言模型合成结构化文本条件表示,以提供高层语义指导。该指导使我们的动作生成器超越了简单的节奏同步,能够生成在上下文和情感上具有共鸣的动作。其次,为确保这些多模态输入的有效融合并缓解模态间冲突,我们引入了一种具有新颖伪末帧设计的专用多模态DiT架构。这些组件的协同作用使我们的模型能够准确解读音频、图像和文本的联合语义,从而生成与角色、场景及语言内容深度一致的动作。大量实验表明,我们的模型在包括唇形同步精度、视频质量、动作自然度和与文本提示的语义一致 性在内的多项指标上均达到了领先性能。此外,我们的方法还展现出对复杂场景(如多人和非人类主体)的显著可扩展性。
6. Pixie: Fast and Generalizable Supervised Learning of 3D Physics from
Pixels
作者: Long Le, Ryan Lucas, Chen Wang, Chuhao Chen, Dinesh Jayaraman, Eric Eaton, Lingjie Liu
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-20 | 👍 点赞数: 31
摘要:
Pixie:从像素中快速且可泛化的3D物理监督学习
从视觉信息中推断3D场景的物理属性是创建交互式和真实感虚拟世界的关键任务,但同时也极具挑战性。尽管人类能够直观地理解诸如弹性或刚度等材料特性,但现有方法通常依赖于缓慢的逐场景优化过程,从而限制了其泛化能力和应用范围。为了解决这一问题,我们提出了PIXIE,一种新颖的方法,通过监督损失函数,仅使用3D视觉特征,训练一个可泛化的神经网络以跨场景预测物理属性。一旦训练完成,我们的前馈网络可以快速推断出合理的材料场,结合类似高斯点绘(Gaussian Splatting)这样的静态场景表示学习方法,能够在外部力作用下实现真实感物理模拟。为推动本领域 研究,我们还构建了PIXIEVERSE数据集,这是目前规模最大的配对3D资产与物理材料标注数据集之一。大量评估表明,PIXIE在性能上比测试阶段优化方法高出约1.46-4.39倍,并且在速度上快出多个数量级。通过利用CLIP等预训练视觉特征,我们的方法即使仅在合成数据上训练,也能实现对真实世界场景的零样本泛化。https://pixie-3d.github.io/
7. Spacer: Towards Engineered Scientific Inspiration
作者: Minhyeong Lee, Suyoung Hwang, Seunghyun Moon, Geonho Nah, Donghyun Koh, Youngjun Cho, Johyun Park, Hojin Yoo, Jiho Park, Haneul Choi, Sungbin Moon, Taehoon Hwang, Seungwon Kim, Jaeyeong Kim, Seongjun Kim, Juneau Jung
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-25 | 👍 点赞数: 28
摘要:
摘要:
近期大型语言模型(LLMs)的发展使自动化科学研究成为通往人工超级智能的下一关键领域。然而,当前系统受限于任务范围狭窄,或受限于LLMs有限的创造力。我们提出Spacer,一种无需外部干预即可生成创造性且事实基础扎实的科学发现系统。Spacer通过“刻意去情境化”方法实现这一目标,该方法将信息拆解为原子单元——关键词,并通过它们之间未被探索的关联激发创造力。Spacer包括两个部分:(i) Nuri,一种灵感引擎,用于构建关键词集合;(ii) 生成管道(Manifesting Pipeline),用于将这些关键词集合提炼为完整的科学陈述。Nuri从基于180,000篇生物学领域学术出版物构建的关键词图中提取新颖且具有高潜力的关键词集。生成管道则在关键词之间寻找关联,分析其逻辑结构,验证其合理性,并最终起草原创科学概念。根据我们的实验,Nuri的评估指标以AUROC得分为0.737的准确率对高影响力出版物进行分类。我们的生成管道还成功地仅从关键词集重构了最新顶级期刊文章的核心概念。基于LLM的评分系统估计,该重构在超过85%的案例中是合理的。最后,我们的嵌入空间分析表明,与当前最先进的LLMs相比,Spacer的输出与领先出版物更为相似。
8. UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior
Long-Context Learning
作者: Zihao Huang, Yu Bao, Qiyang Min, Siyan Chen, Ran Guo, Hongzhi Huang, Defa Zhu, Yutao Zeng, Banggu Wu, Xun Zhou, Siyuan Qiao
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-26 | 👍 点赞数: 26
摘要:
UltraMemV2: 具有卓越长上下文学习能力的1200亿参数内存网络
尽管专家混合(MoE)模型通过仅激活部分参数实现了显著的效率提升,但其在推理过程中存在较高的内存访问成本。内存层架构通过极少的内存访问提供了有吸引力的替代方案,但此前的尝试(如UltraMem)仅能匹敌2专家MoE模型的性能,与最先进的8专家配置仍有显著差距。我们提出了UltraMemV2,一种重新设计的内存层架构,成功弥补了这一性能差距。我们的方法引入了五项关键改进:将内存层集成到每个Transformer块中、通过单一线性投影简化值扩展、采用基于FFN的值处理机制(源自PEER)、实现基于原理的参数初始化,以及重新平衡内存与FFN的计算比例。通过广泛的评估,我们证明UltraMemV2在相同计算资源和参数规模下实现了与8专家MoE模型相当的性能,但内存访问显著降低。值得注意的是,UltraMemV2在内存密集型任务上表现出色,在长上下文记忆任务上提升1.6个百分点,在多轮记忆任务上提升6.2个百分点,在上下文学习任务上提升7.9个百分点。我们在高达1200亿总参数中激活最多25亿参数的模型规模上验证了我们的方法,并发现激活密度对性能的影响大于总稀疏参数数量。我们的工作使内存层架构在性能上达到了与当前最先进的MoE模型相当的水平,为高效稀疏计算提供了一个极具竞争力的替代方案。
9. Autoregressive Universal Video Segmentation Model
作者: Miran Heo, Sukjun Hwang, Min-Hung Chen, Yu-Chiang Frank Wang, Albert Gu, Seon Joo Kim, Ryo Hachiuma
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-26 | 👍 点赞数: 21
摘要:
摘要:
近期的视频基础模型(如SAM2)通过将掩码视为通用基元,在提示视频分割任务中表现出色。然而,许多实际场景需要无提示分割,即在没有外部线索的情况下检测并跟踪视频中的所有物体,这导致当前的方法分散在不同的任务专用模型和流程中。我们将视频流分割重新定义为序列掩码预测问题,类似于语言建模,并由此提出自回归通用分割模型(Autoregressive Universal Segmentation Model,AUSM),该模型采用统一架构同时支持提示与无提示视频分割。AUSM基于近期的状态空间模型构建,维护一个固定大小的空间状态,可扩展至任意长度的视频流。此外,AUSM的所有组件均支持跨帧并行训练,相较于迭代训练方式实现了显著的速度提升。在多个标准基准测试(DAVIS17、YouTube-VOS 2018 & 2019、MOSE、YouTube-VIS 2019 & 2021 以及 OVIS)中,AUSM均优于以往的通用视频流分割方法,并在16帧序列上的训练速度最高提升了2.5倍。
10. CineScale: Free Lunch in High-Resolution Cinematic Visual Generation
作者: Haonan Qiu, Ning Yu, Ziqi Huang, Paul Debevec, Ziwei Liu
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-21 | 👍 点赞数: 18
摘要:
视觉扩散模型取得了显著进展,但由于缺乏高分辨率数据和受限的计算资源,它们通常仅在有限分辨率下进行训练,这限制了其在更高分辨率下生成高保真图像或视频的能力。近期研究探索了无需调优的策略,以挖掘预训练模型在更高分辨率视觉生成方面的潜力。然而,这些方法仍容易生成具有重复模式的低质量视觉内容。关键障碍在于当模型生成超过其训练分辨率的视觉内容时,高频信息不可避免地增加,从而导致由累积误差引发的重复模式。本文提出了CineScale,一种新颖的推理范式,以实现更高分辨率的视觉生成。为应对两种视频生成架构所带来的不同问题,我们分别为其设计了专门的变体。与现有仅限于高分辨率T2I(文本到图像)和T2V(文本到视频)生成的基线方法不同,CineScale扩展了应用范围,支持基于当前最先进的开源视频生成框架实现高分辨率的I2V(图像到视频)和V2V(视频到视频)合成。大量实验验证了我们的范式在提升图像和视频模型高分辨率生成能力方面的优越性。特别值得一提的是,我们的方法无需任何微调即可实现8K图像生成,并通过仅需少量LoRA微调即可实现4K视频生成。生成的视频样例请访问我们的网站:https://eyeline-labs.github.io/CineScale/。
11. ThinkDial: An Open Recipe for Controlling Reasoning Effort in Large
Language Models
作者: Qianyu He, Siyu Yuan, Xuefeng Li, Mingxuan Wang, Jiangjie Chen
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-26 | 👍 点赞数: 13
摘要:
ThinkDial: 一种用于控制大语言模型推理代价的开源方案
具有思维链推理能力的大语言模型(LLMs)已经展现出卓越的问题求解能力,但在实际部署中控制其计算代价仍然是一个重大挑战。近期一些专有系统(如OpenAI的gpt-oss系列)引入了离散操作模式以实现直观的推理控制,但开源社区在实现此类功能方面进展有限。本文提出了ThinkDial,这是首个基于开源方案实现端到端流程的框架,成功实现了类似gpt-oss风格的可控推理功能,通过离散操作模式进行控制。我们的系统支持在三种不同的推理模式之间无缝切换:High模式(完整推理能力)、Medium模式(减少50%的token数量且性能下降<10%)以及Low模式(减少75%的token数量且性能下降<15%)。我们通过一种集成预算模式控制的端到端训练范式实现了这一目标:预算模式监督微调(budget-mode supervised fine-tuning)将可控推理能力直接嵌入学习过程,以及结合自适应奖励塑造的两阶段预算感知强化学习(two-phase budget-aware reinforcement learning)。大量实验表明,ThinkDial能够在保持性能阈值的前提下,实现目标压缩与性能之间的权衡,并显著减少响应长度。此外,该框架在分布外任务上也表现出较强的泛化能力。
12. Wan-S2V: Audio-Driven Cinematic Video Generation
作者: Xin Gao, Li Hu, Siqi Hu, Mingyang Huang, Chaonan Ji, Dechao Meng, Jinwei Qi, Penchong Qiao, Zhen Shen, Yafei Song, Ke Sun, Linrui Tian, Guangyuan Wang, Qi Wang, Zhongjian Wang, Jiayu Xiao, Sheng Xu, Bang Zhang, Peng Zhang, Xindi Zhang, Zhe Zhang, Jingren Zhou, Lian Zhuo
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-26 | 👍 点赞数: 13
摘要:
当前最先进的(SOTA)音频驱动角色动画方法在主要涉及语音和歌唱的场景中表现出良好的性能。然而,在更为复杂的影视制作中,这些方法往往难以满足需求,例如细腻的角色互动、逼真的身体动作以及动态的摄像机操作等复杂元素。为应对实现影视级角色动画这一长期挑战,我们在Wan的基础上提出了一种音频驱动模型,称为Wan-S2V。与现有方法相比,我们的模型在影视 场景中实现了显著增强的表现力和保真度。我们进行了广泛的实验,将本方法与Hunyuan-Avatar和Omnihuman等前沿模型进行基准测试。实验结果一致表明,我们的方法显著优于现有方案。此外,我们还通过长视频生成和精确的视频唇形同步编辑等应用场景,探索了本方法的多功能性。
13. FastMesh:Efficient Artistic Mesh Generation via Component Decoupling
作者: Jeonghwan Kim, Yushi Lan, Armando Fortes, Yongwei Chen, Xingang Pan
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-26 | 👍 点赞数: 12
摘要:
FastMesh: 通过组件解耦实现高效的艺术网格生成
近期的网格生成方法通常将三角网格分词为一系列标记,并训练自回归模型按顺序生成这些标记。尽管取得了显著进展,但这种标记序列不可避免地需要多次重复使用顶点以完整表示流形网格,因为每个顶点被多个面共享。这种冗余导致了过长的标记序列和低效的生成过程。本文中,我们提出了一种高效的框架,通过分别处理顶点和面来生成艺术网格,显著减少了冗余。我们仅对顶点生成使用自回归模型,将标记数量减少到现有最紧凑分词器所需数量的大约23%。接下来,我们利用一个双向Transformer通过捕捉顶点间关系并构建定义网格面的邻接矩阵,在单一步骤中完成网格生成。为进一步提高生成质量,我们引入了一个保真度增强模块,以将顶点位置优化为更自然的排列,并提出了一种后处理框架以去除不理想的边连接。实验结果表明,与最先进的方法相比,我们的方法在生成速度上提高了8倍以上,同时生成了更高质量的网格。
14. DrugReasoner: Interpretable Drug Approval Prediction with a
Reasoning-augmented Language Model
作者: Mohammadreza Ghaffarzadeh-Esfahani, Ali Motahharynia, Nahid Yousefian, Navid Mazrouei, Jafar Ghaisari, Yousof Gheisari
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-26 | 👍 点赞数: 12
摘要:
DrugReasoner:基于推理增强型语言模型的可解释药物批准预测
药物发现是一个复杂且资源密集的过程,使得在早期预测药物批准结果对于优化研究投资至关重要。尽管传统的机器学习和深度学习方法在药物批准预测中展现出一定的潜力,但其有限的可解释性限制了其影响力。本文中,我们提出了DrugReasoner,这是一种基于推理的大型语言模型(LLM),构建于LLaMA架 构之上,并通过组相对策略优化(GRPO)进行微调,用于预测小分子药物获批的可能性。DrugReasoner将分子描述符与对结构相似的已获批和未获批化合物的对比推理相结合,生成预测结果的同时输出逐步推理过程和置信度评分。DrugReasoner在验证集上取得了0.732的AUC值和0.729的F1分数,在测试集上分别达到0.725和0.718,表现出稳健的性能。这些结果优于传统的基线模型,包括逻辑回归、支持向量机和k近邻算法,并与XGBoost模型具有相当的竞争力。在外部独立数据集上,DrugReasoner的表现优于基线模型和近期开发的ChemAP模型,AUC值达到0.728,F1分数为0.774,同时保持了高精度和均衡的灵敏度,显示出在实际应用场景中的稳健性。这些研究结果表明,DrugReasoner不仅具有出色的预测准确性,还通过其推理输出增强了模型的透明度,从而解决了人工智能辅助药物发现中的一个关键瓶颈。本研究突出了推理增强型LLM在制药决策中作为可解释且有效工具的潜力。
15. ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks
作者: Minghao Li, Ying Zeng, Zhihao Cheng, Cong Ma, Kai Jia
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-08-14 | 👍 点赞数: 11
摘要:
摘要:
Deep Research智能体的出现大幅缩短了完成广泛研究任务所需的时间。然而,这些任务本质上要求严格的事实准确性和全面性,在广泛采用之前需要进行彻底评估。本文提出了ReportBench,一个系统性基准,旨在评估由大语言模型(LLMs)生成的研究报告的内容质量。我们的评估聚焦于两个关键维度:(1) 引用文献的质量与相关性,以及 (2) 报告中陈述语句的忠实性与真实性。ReportBench利用arXiv上已发表的高质量综述论文作为黄金标准参考,通过逆向提示工程从中推导出领域特定的提示,并构建了一个全面的评估语料库。此外,我们在ReportBench中开发了一个基于智能体的自动化框架,通过提取引用文献和陈述语句、检查引用内容相对于原始来源的忠实性,以及利用网络资源验证未引用的陈述,系统性地分析生成的报告。实证评估表明,与结合搜索或浏览工具的独立LLMs相比,如OpenAI和Google开发的商用Deep Research智能体能够持续生成更全面且更可靠的报告。然而,在研究覆盖的广度与深度以及事实一致性方面,仍有较大的改进空间。完整的代码和数据将发布于以下链接:https://github.com/ByteDance-BandAI/ReportBench