面向多模态多方对话中受话者识别的LLM基准
计算与语言
2025-03-19 v2 人工智能
声音
音频与语音处理
摘要
处理多方对话是推进口语对话系统的重要一步,需要开发针对多方交互的任务。为应对这一挑战,我们正在构建一个三元组(三方参与者)讨论的多模态多方对话语料库。本文聚焦于受话者识别任务,即识别谁被指定为下一轮发言者,这是多方对话系统特有的关键组成部分。语料库的一个子集标注了受话者信息,结果显示大约20%的对话轮次中明确指出了受话者。为评估任务的复杂性,我们在大语言模型(GPT-4o)上对受话者识别进行了基准测试。结果表明,GPT-4o的准确率仅略高于随机水平,凸显了多方对话中受话者识别的挑战。这些发现强调了需要进一步研究以增强大语言模型理解和驾驭多方对话动态复杂性的能力。
引用
@article{arxiv.2501.16643,
title = {An LLM Benchmark for Addressee Recognition in Multi-modal Multi-party Dialogue},
author = {Koji Inoue and Divesh Lala and Mikey Elmers and Keiko Ochi and Tatsuya Kawahara},
journal= {arXiv preprint arXiv:2501.16643},
year = {2025}
}
备注
This paper has been accepted for presentation at International Workshop on Spoken Dialogue Systems Technology 2025 (IWSDS 2025) and represents the author's version of the work