超越文本:利用声音线索提升机器人导航任务中大型语言模型的决策能力
人工智能
2024-11-12 v3 机器人学
摘要
尽管大型语言模型(LLMs)在处理人类对话中的文本方面表现出色,但在社交导航等场景中,它们难以把握口头指令的细微差别,而此类场景中的歧义和不确定性会削弱人们对机器人及其他人工智能系统的信任。我们可以通过超越文本并额外关注这些音频响应的副语言特征来弥补这一不足。这些特征是口语交流中不涉及字面措辞(词汇内容),而是通过说话方式传达意义和细微差别的方面。我们提出了Beyond Text:一种通过整合音频转录以及一部分专注于情感且在人机对话中更相关的副语言特征,来改进LLM决策的方法。该方法不仅取得了70.26%的胜率,分别比现有LLM(gemini-1.5-pro和gpt-3.5)高出22.16%至48.30%,而且还增强了对令牌操纵对抗攻击的鲁棒性,其胜率下降幅度比纯文本语言模型低22.44%。Beyond Text标志着社交机器人导航和更广泛的人机交互领域的一项进步,它将基于文本的引导与基于人类音频信息的语言模型无缝集成。
引用
@article{arxiv.2402.03494,
title = {Beyond Text: Utilizing Vocal Cues to Improve Decision Making in LLMs for Robot Navigation Tasks},
author = {Xingpeng Sun and Haoming Meng and Souradip Chakraborty and Amrit Singh Bedi and Aniket Bera},
journal= {arXiv preprint arXiv:2402.03494},
year = {2024}
}
备注
30 pages, 7 figures