每日论文 - 2025年10月03日
论文总数: 52
1. LongCodeZip: Compress Long Context for Code Language Models
作者: Yuling Shi, Yichun Qian, Hongyu Zhang, Beijun Shen, Xiaodong Gu
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-10-01 | 👍 点赞数: 91
摘要:
论文标题:LongCodeZip:面向代码语言模型的长上下文压缩方法
中文摘要:
随着大语言模型(LLMs)需要在大规模代码库中进行复杂推理,长上下文下的代码生成正变得愈发关键。尽管近期研究已使代码大模型能够处理长输入,高昂的API成本和生成延迟仍是显著瓶颈。现有的上下文剪枝技术(如LLMLingua)在通用文本上表现良好,却忽视了代码特有的结构与依赖关系,导致在编程任务中性能欠佳。本文提出LongCodeZip,一种专为代码大模型设计的新型即插即用式压缩框架。LongCodeZip采用两阶段压缩策略:(1)粗粒度压缩,通过基于指令条件困惑度(conditional perplexity)对函数级代码块进行识别与排序,仅保留最相关的函数;(2)细粒度压缩,将保留的函数依据困惑度划分为语句块,并在自适应的token预算下选择最优子集,以最大化相关性。在代码补全、代码摘要和代码问答等多个任务上的实验表明,LongCodeZip始终优于基线方法,在不损害任务性能的前提下实现了最高达5.6倍的压缩比。通过有效减小上下文规模同时保留关键信息,LongCodeZip有助于大模型更好地适应真实世界中的大规模代码场景,推动代码智能应用的效率与能力发展。
2. Self-Forcing++: Towards Minute-Scale High-Quality Video Generation
作者: Justin Cui, Jie Wu, Ming Li, Tao Yang, Xiaojie Li, Rui Wang, Andrew Bai, Yuanhao Ban, Cho-Jui Hsieh
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-10-02 | 👍 点赞数: 70
摘要:
论文标题:Self-Forcing++:迈向分钟级高质量视频生成
中文摘要:
扩散模型在图像与视频生成领域取得了革命性进展,实现了前所未有的视觉质量。然而,其依赖的Transformer架构带来了极高的计算成本,尤其是在生成长视频时问题尤为突出。近期研究探索了基于自回归框架的长视频生成方法,通常通过从短时双向教师模型中进行知识蒸馏来实现。但由于教师模型本身无法生成长视频,学生模型在超出训练时间范围的外推过程中往往会出现显著的质量退化,这是由于连续潜在空间中的误差不断累积所致。本文提出了一种简单而有效的方法,在无需长视频教师模型监督或在长视频数据集上重新训练的情况下,缓解长时视频生成中的质量退化问题。我们的方法核心在于充分利用教师模型所蕴含的丰富知识,通过对模型自身生成的长视频中采样的片段来为学生模型提供指导。该方法在将视频长度扩展至教师模型能力20倍的同时,仍保持了良好的时间一致性,并避免了过曝、误差累积等常见问题,且无需像以往方法那样重新计算重叠帧。在进一步扩大计算规模后,我们的方法能够生成最长达4分15秒的视 频,相当于基础模型位置编码所支持最大时长的99.9%,比基线模型的生成长度超过50倍以上。在标准基准数据集以及我们新构建的改进型评测基准上的实验结果表明,我们的方法在生成保真度和时序一致性方面均显著优于现有基线方法。我们的长视频生成演示可访问:https://self-forcing-plus-plus.github.io/
3. ExGRPO: Learning to Reason from Experience
作者: Runzhe Zhan, Yafu Li, Zhi Wang, Xiaoye Qu, Dongrui Liu, Jing Shao, Derek F. Wong, Yu Cheng
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-10-02 | 👍 点赞数: 63
摘要:
论文标题:ExGRPO:从经验中学习推理
中文摘要:
基于可验证奖励的强化学习(RLVR)是一种新兴范式,旨在提升大语言模型的推理能力。然而,标准的策略内训练方法在单次更新后即丢弃 rollout 产生的经验,导致计算效率低下和训练不稳定。尽管先前关于强化学习的研究已指出重用历史经验的优势,但经验特征如何影响大模型推理学习动态的问题仍缺乏深入探索。本文首次研究了何种因素使推理经验具有价值,并发现 rollout 的正确性与熵值是衡量经验价值的有效 指标。基于这些发现,我们提出了 ExGRPO(经验式分组相对策略优化),该框架能够组织并优先利用高价值经验,并采用混合策略目标来平衡探索与经验利用。在五个不同骨干模型(参数量15亿至80亿)上的实验表明,ExGRPO 在数学和通用推理基准任务上持续提升推理性能,相比标准策略内 RLVR 方法平均提升 +3.5 和 +7.6 分。此外,ExGRPO 能在强模型和弱模型上均实现稳定训练,而策略内方法在此类情况下往往失败。这些结果表明,系统化的经验管理是实现高效且可扩展的 RLVR 的关键要素。
4. StealthAttack: Robust 3D Gaussian Splatting Poisoning via Density-Guided
Illusions
作者: Bo-Hsu Ke, You-Zhe Xie, Yu-Lun Liu, Wei-Chen Chiu
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-10-02 | 👍 点赞数: 53
摘要:
论文标题:StealthAttack:基于密度引导幻象的鲁棒3D高斯点阵投毒攻击
中文摘要:
近年来,神经辐射场(Neural Radiance Fields, NeRF)和3D高斯点阵(3D Gaussian Splatting, 3DGS)等三维场景表示方法在新视角合成方面取得了显著进展。随着这些方法的广泛应用,其安全性与脆 弱性问题日益凸显。本文针对3DGS在图像级投毒攻击下的鲁棒性进行分析,并提出一种新颖的密度引导型投毒方法。该方法通过核密度估计(Kernel Density Estimation, KDE)识别出点云中的低密度区域,并策略性地向这些区域注入高斯点,在中毒视角下生成清晰可见的、依赖视角的幻象物体,同时对正常视角的影响最小。此外,我们引入一种自适应噪声策略,以破坏多视角之间的一致性,进一步提升攻击效果。为系统评估攻击难度,我们提出基于KDE的评测协议,为未来相关研究提供客观的基准测试手段。大量实验结果表明,所提方法在性能上显著优于当前最先进的技术。项目主页:https://hentci.github.io/stealthattack/
5. StockBench: Can LLM Agents Trade Stocks Profitably In Real-world
Markets?
作者: Yanxu Chen, Zijun Yao, Yantao Liu, Jin Ye, Jianing Yu, Lei Hou, Juanzi Li
链接: 📄 ArXiv | 🤗 HuggingFace
信息: 📅 发布日期: 2025-10-02 | 👍 点赞数: 38
摘要:
论文标题:StockBench:大语言模型代理能否在真实市场中盈利性地进行股票交易?
中 文摘要:
近年来,大语言模型(LLMs)展现出作为自主代理的强大能力,在推理、工具使用和序列化决策方面表现出巨大潜力。尽管已有基准测试在软件工程和科学发现等领域对LLM代理进行了评估,但金融领域仍相对缺乏探索,而该领域与经济价值和高风险决策密切相关。现有的金融基准主要通过问答形式测试静态知识,难以反映交易过程中动态且迭代的本质。为填补这一空白,我们提出了StockBench——一个无污染的基准测试框架,旨在评估LLM代理在真实、持续数月的股票交易环境中的表现。代理每天接收包括价格、基本面数据和新闻在内的市场信号,并需依次做出买入、卖出或持有的决策。其性能通过累计收益、最大回撤和索提诺比率(Sortino ratio)等金融指标进行评估。我们对当前最先进的闭源模型(如GPT-5、Claude-4)和开源权重模型(如Qwen3、Kimi-K2、GLM-4.5)的评估结果显示,尽管大多数LLM代理难以超越简单的“买入并持有”基准策略,但部分模型已展现出实现更高收益并更有效管理风险的潜力。这些发现凸显了构建基于LLM的金融代理所面临的挑战与机遇,表明在静态金融知识任务上的优异表现并不必然转化为成功的交易策略。我们已将StockBench作为开源资源公开发布,以支持研究的可重复性,并推动该领域的后续发展。