中文

利用脑激活细化自监督学习的语音表征

音频与语音处理 2024-06-14 v2 声音

摘要

文献中已表明,由自监督预训练模型提取的语音表征在语音感知和细化语音表征模型以适应下游任务方面 exhibits 与人类脑激活的相似性。然而,仍不清楚这种相似性是否可用于优化预训练语音模型。因此,本文提出利用 fMRI 记录的脑激活通过对齐模型表征以人类神经响应为导向来细化常用的 wav2vec2.0 模型。在 SUPERB 上的实验结果表明,这一操作对多个下游任务(如说话人验证、自动语音识别、意图分类)都有益处。可以将所提出的方法视为改进自监督语音模型的新型替代方案。

关键词

引用

@article{arxiv.2406.08266,
  title  = {Refining Self-Supervised Learnt Speech Representation using Brain Activations},
  author = {Hengyu Li and Kangdi Mei and Zhaoci Liu and Yang Ai and Liping Chen and Jie Zhang and Zhenhua Ling},
  journal= {arXiv preprint arXiv:2406.08266},
  year   = {2024}
}

备注

accpeted by Interspeech2024