口语化虚拟形象系统的人类延迟对话轮换
人机交互
2024-04-26 v1 人工智能
计算与语言
摘要
当前许多由大型语言模型驱动的口语对话系统的一个问题是响应时间。一些努力如Groq通过闪电般快速的LLM处理来解决这个问题,但从认知心理学文献中我们知道,在人与人对话中,响应往往在说话者完成话语之前就发生了。如果我们希望保持人类对话延迟,任何LLM处理的延迟都是不可接受的。在本文中,我们讨论了近乎实时理解话语并生成响应的方法,以便系统能够符合人类水平的对话轮换延迟。这意味着说话者话语最后部分的信息内容对LLM来说是丢失的。使用Google NaturalQuestions (NQ)数据库,我们的结果显示GPT-4能够有效填补问题末尾丢失单词的缺失上下文,成功率超过60%。我们还提供了一些话语示例以及这种信息丢失对LLM响应质量的影响,这些示例是在一个正在开发的虚拟形象上下文中。这些结果表明,一个简单的分类器可以用来判断一个问题在语义上是否完整,或者是否需要填充短语以允许在人类对话时间约束内生成响应。
引用
@article{arxiv.2404.16053,
title = {Human Latency Conversational Turns for Spoken Avatar Systems},
author = {Derek Jacoby and Tianyi Zhang and Aanchan Mohan and Yvonne Coady},
journal= {arXiv preprint arXiv:2404.16053},
year = {2024}
}