利用大规模跨语言模型建立音频录音在不同维度上的相似度
计算与语言
2024-02-09 v1 声音
音频与语音处理
摘要
在低资源语言研究的高度受限环境中,我们探索了来自预训练模型的语音向量,以确定其相对于音频信号的抽象程度。我们提出了一种新型无监督方法,使用 ABX 测试对具有精心挑选元数据的数据中的音频录音进行分析,以阐明表示中存在的类型信息。ABX 测试确定由多语言语音模型计算的表示是否编码了给定特征。设立了三个实验:一个关于房间声学特性,一个关于语言/非语言特征,一个关于语音特征。结果确认,来自不同语言/非语言特征录音的表示在相同的维度上存在差异。将更多音频信号嵌入一个向量有助于更好地区分非语言特征,而更短的片段则更适合区分段际信息。该方法是完全无监督的,可能为对缺乏文档语言的比较研究开辟新的研究方向。
引用
@article{arxiv.2402.05581,
title = {Establishing degrees of closeness between audio recordings along different dimensions using large-scale cross-lingual models},
author = {Maxime Fily and Guillaume Wisniewski and Severine Guillaume and Gilles Adda and Alexis Michaud},
journal= {arXiv preprint arXiv:2402.05581},
year = {2024}
}
备注
Published in Findings of the EACL2024