中文

探索大型多模态模型中的语音特定风险:分类体系、基准与洞见

计算与语言 2024-06-26 v1 声音 音频与语音处理

摘要

大型多模态模型(LMM)近期取得了巨大成功,展现出理解多模态信息并与人类用户交互的强大能力。尽管取得了进展,但在多模态环境,特别是语音模态中检测高风险交互的挑战在很大程度上仍未得到探索。针对语音模态风险的常规研究主要强调内容(例如,转录捕获的内容)。然而,在基于语音的交互中,音频中的副语言线索可以显著改变话语背后的意图。在这项工作中,我们提出了一个语音特定的风险分类体系,涵盖了敌意(恶意讽刺和威胁)、恶意模仿(年龄、性别、种族)和刻板偏见(年龄、性别、种族)下的8个风险类别。基于该分类体系,我们创建了一个小规模数据集,用于评估当前LMM检测这些风险类别的能力。我们观察到,即使是最新的模型在检测语音中各种副语言特定风险方面仍然效果不佳(例如,Gemini 1.5 Pro的表现仅略高于随机基线)。警告:本文包含有偏见和冒犯性的例子。

关键词

引用

@article{arxiv.2406.17430,
  title  = {Towards Probing Speech-Specific Risks in Large Multimodal Models: A Taxonomy, Benchmark, and Insights},
  author = {Hao Yang and Lizhen Qu and Ehsan Shareghi and Gholamreza Haffari},
  journal= {arXiv preprint arXiv:2406.17430},
  year   = {2024}
}