中文

CoLMbo:用于描述性画像的说话人语言模型

计算与语言 2025-08-26 v2 声音 音频与语音处理

摘要

说话人识别系统通常局限于分类任务,难以生成详细的说话人特征或提供丰富的上下文描述。这些模型主要提取嵌入向量用于说话人识别,但无法以结构化方式捕捉方言、性别和年龄等人口统计属性。本文提出 CoLMbo,一种说话人语言模型(SLM),通过将说话人编码器与基于提示的条件化相结合来解决这些限制。这使得能够基于说话人嵌入创建详细的描述。CoLMbo 利用用户定义的提示动态适应新的说话人特征,并提供定制化描述,包括区域方言变化和与年龄相关的特征。这一创新方法不仅增强了传统说话人画像,还在多样化数据集的零样本场景中表现出色,标志着说话人识别领域的重大进展。

关键词

引用

@article{arxiv.2506.09375,
  title  = {CoLMbo: Speaker Language Model for Descriptive Profiling},
  author = {Massa Baali and Shuo Han and Syed Abdul Hannan and Purusottam Samal and Karanveer Singh and Soham Deshmukh and Rita Singh and Bhiksha Raj},
  journal= {arXiv preprint arXiv:2506.09375},
  year   = {2025}
}

备注

Accepted to ASRU 2025