CoLMbo:用于描述性画像的说话人语言模型
计算与语言
2025-08-26 v2 声音
音频与语音处理
摘要
说话人识别系统通常局限于分类任务,难以生成详细的说话人特征或提供丰富的上下文描述。这些模型主要提取嵌入向量用于说话人识别,但无法以结构化方式捕捉方言、性别和年龄等人口统计属性。本文提出 CoLMbo,一种说话人语言模型(SLM),通过将说话人编码器与基于提示的条件化相结合来解决这些限制。这使得能够基于说话人嵌入创建详细的描述。CoLMbo 利用用户定义的提示动态适应新的说话人特征,并提供定制化描述,包括区域方言变化和与年龄相关的特征。这一创新方法不仅增强了传统说话人画像,还在多样化数据集的零样本场景中表现出色,标志着说话人识别领域的重大进展。
引用
@article{arxiv.2506.09375,
title = {CoLMbo: Speaker Language Model for Descriptive Profiling},
author = {Massa Baali and Shuo Han and Syed Abdul Hannan and Purusottam Samal and Karanveer Singh and Soham Deshmukh and Rita Singh and Bhiksha Raj},
journal= {arXiv preprint arXiv:2506.09375},
year = {2025}
}
备注
Accepted to ASRU 2025