中文

ExVo 多任务学习赛道中监督与自监督嵌入的比较

声音 2022-07-26 v1 音频与语音处理

摘要

ICML 2022 表达性发声(ExVo)多任务挑战赛聚焦于理解非语言发声(发声爆发(VB))的情感层面。该挑战赛的目标是预测 VB 的情感强度,作为一个多任务挑战,它还需预测说话者的年龄与母语国家。针对此挑战,我们研究并比较了两种不同的嵌入空间,即基于自监督学习(SSL)的嵌入与基于任务特定监督学习的嵌入。为此,我们考察了若干预训练 SSL 神经网络与任务特定监督分类神经网络所获得的特征表示。我们的研究表明,最佳性能由混合方法取得,即同时使用经 SSL 与任务特定监督学习得到的预测。我们在测试集上的最佳系统以相对 13% 的优势超越了 ComPARE 基线(所有子任务得分的调和均值,即 SMTLS_{MTL})。

关键词

引用

@article{arxiv.2206.11968,
  title  = {Comparing supervised and self-supervised embedding for ExVo Multi-Task learning track},
  author = {Tilak Purohit and Imen Ben Mahmoud and Bogdan Vlasenko and Mathew Magimai. -Doss},
  journal= {arXiv preprint arXiv:2206.11968},
  year   = {2022}
}