中文

VARAN:面向下游任务的自监督语音模型变分推断微调框架

机器学习 2025-08-19 v1

摘要

传统方法用于聚合自监督语音模型在下游任务上的微调层(例如使用最终层或加权求和),存在信息瓶颈和针对所有数据集示例的静态特征加权问题。我们提出VARAN框架,动态地针对单个输入调整图层聚合。通过采用层特化探针头和数据依赖的加权,VARAN根据输入自适应地优先考虑各层特征。在自动语音识别和语音情感识别任务上的评估表明,VARAN的性能尤其在使用LoRA微调技术时表现突出。该框架解决了保留层特定信息与实现灵活特征利用之间的权衡,推动了自监督语音表征的高效适应。

关键词

引用

@article{arxiv.2508.12061,
  title  = {VARAN: Variational Inference for Self-Supervised Speech Models Fine-Tuning on Downstream Tasks},
  author = {Daria Diatlova and Nikita Balagansky and Alexander Varlamov and Egor Spirin},
  journal= {arXiv preprint arXiv:2508.12061},
  year   = {2025}
}