在人类语音上预训练的自监督神经表示能否区分动物呼叫者?
机器学习
2023-06-09 v3 声音
音频与语音处理
摘要
自监督学习(SSL)模型仅利用给定信号的内在结构(独立于其声学域)从输入中提取本质信息至嵌入空间。这意味着此类表示的效用并不限于仅对人类语音建模。基于这一认识,本文探索从人类语音学习的 SSL 神经表示向生物声学信号分析的跨可迁移性。我们使用十一个以不同 pretext task 预训练的 SSL 模型,对狨猴发声进行呼叫者判别分析与呼叫者检测研究。结果表明,嵌入空间携带有意义的呼叫者信息,且无需微调即可成功区分狨猴呼叫者的个体身份。这证明在人类语音上预训练的表示可有效应用于生物声学域,为该领域未来研究提供了宝贵见解。
引用
@article{arxiv.2305.14035,
title = {Can Self-Supervised Neural Representations Pre-Trained on Human Speech distinguish Animal Callers?},
author = {Eklavya Sarkar and Mathew Magimai. -Doss},
journal= {arXiv preprint arXiv:2305.14035},
year = {2023}
}
备注
Accepted at Interspeech 2023