中文

基于强化修补的动态分词:端到端训练与零样本迁移

机器学习 2026-03-30 v1 人工智能 机器学习

摘要

高效聚合空间或时间范围以获取紧凑表示已成为现代深度学习模型的统一原则,然而学习面向长范围序列数据(尤其是时间序列等连续序列)的数据自适应表示仍是一个开放挑战。虽然固定大小的修补已提升了可扩展性和性能,但以端到端方式发现数据驱动的可变大小修补往往迫使模型依赖软离散化、特定骨干网络或启发式规则。在本文中,我们提出Reinforcement Patching(ReinPatch),首个通过强化学习联合优化序列修补策略及其下游序列骨干模型的框架。通过将修补边界放置建模为通过Group Relative Policy Gradient(GRPG)优化的离散决策过程,ReinPatch无需连续松弛即可自然地执行动态修补策略优化。此外,我们的方法允许严格强制期望的压缩率,使下游骨干网络能够高效扩展,并天然支持多级层次建模。我们在时间序列预测数据集上评估ReinPatch,结果表明其相较于当前最先进的数据驱动修补策略具有令人瞩目的性能。此外,我们的解耦设计允许将修补模块提取为独立的基础修补器,为社区提供关于纯粹由性能驱动的神经修补策略所偏好的分割行为的视觉和实证洞察。

关键词

引用

@article{arxiv.2603.26097,
  title  = {Dynamic Tokenization via Reinforcement Patching: End-to-end Training and Zero-shot Transfer},
  author = {Yulun Wu and Sravan Kumar Ankireddy and Samuel Sharpe and Nikita Seleznev and Dehao Yuan and Hyeji Kim and Nam H. Nguyen},
  journal= {arXiv preprint arXiv:2603.26097},
  year   = {2026}
}