中文

晚期融合与多级裂变放大文本-语音语言模型中的跨模态迁移

计算与语言 2025-10-21 v2 人工智能 音频与语音处理

摘要

文本-语音语言模型(TSLMs)——被训练以联合处理和生成文本与语音的语言模型——通常通过早期模态融合/裂变方法进行训练,其中两种模态均通过线性层从共享骨干网络输入并预测。我们假设这种方法由于忽略了特征组合性——具体而言,与文本相比,语音表征具有更细粒度的性质——从而限制了跨模态迁移,阻碍了模型层内共享特征层次结构的出现。在本文中,我们论证了这一局限性可以通过晚期融合与裂变来解决,且该裂变过程可同时访问高层和低层特征以生成语音。我们实现了这些原则的模型 SmolTolk,能够匹敌或超越使用多数量级计算资源训练的 SOTA TSLMs,并且与早期融合/裂变基线相比,实现了显著提升的跨模态性能。表征分析进一步表明,我们的方法增强了模型从语音中抽象出更高层次、更具语义特征的能力,并使得跨层的表征空间日益共享。

关键词

引用

@article{arxiv.2503.06211,
  title  = {Late Fusion and Multi-Level Fission Amplify Cross-Modal Transfer in Text-Speech LMs},
  author = {Santiago Cuervo and Adel Moumen and Yanis Labrak and Sameer Khurana and Antoine Laurent and Mickael Rouvier and Phil Woodland and Ricard Marxer},
  journal= {arXiv preprint arXiv:2503.06211},
  year   = {2025}
}