PairAlign:基于自对齐的序列分词框架及其在音频分词中的应用
机器学习
2026-05-08 v1 计算与语言
声音
摘要
对感官数据的许多操作——比较、记忆、检索和推理——自然地在离散符号结构上进行表达。在语言中,这一接口由分词给出;而在音频中,它必须被学习。现有的音频分词器依赖量化、聚类或编解码器重建,并在局部进行分词,因此序列一致性、紧凑性、长度控制、终止和编辑相似性很少被直接优化。我们引入 PairAlign,一个通过序列级自对齐实现紧凑音频分词的框架。PairAlign 将分词视为条件序列生成:编码器将语音映射为连续条件,自回归解码器从 BOS 开始生成分词,学习分词身份、顺序、长度和 EOS 位置。给定两个保内容视图,每个视图的序列被训练为在另一视图的表示下具有高似然,而不相关的样本则提供竞争序列。这为编辑距离保持提供了一个可扩展的替代目标,同时抑制多对一坍缩。PairAlign 从 VQ 风格分词出发,利用 EMA 教师目标、交叉配对教师强制、前缀破坏、似然对比和长度控制对其进行优化。在 3 秒语音上,PairAlign 学习到了紧凑、非简并的序列,具有广泛的词表使用和强跨视图一致性。在 TIMIT 检索任务中,它保持了编辑距离搜索,同时将归档分词数量减少了 55%。连续扫描探针实验表明,其局部重叠低于密集几何分词器,但在 100 ms 偏移下具有更强的长度控制和有界编辑轨迹。PairAlign 是一个序列符号预测学习器:类似于 JEPA 风格目标,它从另一视图预测抽象目标,作为学习到的可变长度符号序列,而非连续潜变量。
引用
@article{arxiv.2605.06582,
title = {PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization},
author = {Adhiraj Banerjee and Vipul Arora},
journal= {arXiv preprint arXiv:2605.06582},
year = {2026}
}
备注
101 pages, 7 Figures, pre-print, Under Review