SLAP:从自然语言监督中学习说话人与健康相关表征
音频与语音处理
2025-10-03 v1 声音
摘要
语音编码包含人口统计学、声音质量和健康等副语言信息。然而,目前没有音频基础模型支持对这些任务进行零样本或跨分布(OOD) generalization。我们引入SLAP(Speaker contrastive Language-Audio Pretraining),第一个将语音与说话人和健康元数据自然语言描述通过对比学习对齐的模型。SLAP将一个视觉Transformer音频编码器与文本编码器结合,在超过3400小时、跨9个数据集的多样化说话人标注数据上进行训练。我们在38个二元分类任务上进行评估,涵盖人口统计学、语音特征和临床评估,在14个数据集、7种语言中进行测试。SLAP在零样本评估中实现62.9%的平均F1分数,相较于CLAP(42.4%)提升了48%的相对 improvement,同时在针对未见语言和临床人群的OOD generalization表现良好。当使用线性探针进行微调时,SLAP实现69.3%的总体F1分数,并在健康任务上实现最佳水平性能(57.9%F1),超越了更大的基础模型。
引用
@article{arxiv.2510.01860,
title = {SLAP: Learning Speaker and Health-Related Representations from Natural Language Supervision},
author = {Angelika Ando and Auguste Crabeil and Adrien Lesage and Rachid Riad},
journal= {arXiv preprint arXiv:2510.01860},
year = {2025}
}