将 LLM 能力应用于 VR 环境中多个对话式化身的经验教训
人机交互
2025-01-08 v2
摘要
我们展示了一个集成自动语音识别(ASR)、文本转语音(TTS)和唇同步技术的虚拟现实(VR)环境, featuring 以本地部署的 LLM 为动力的对话式化身。通过一个小规模研究,我们探讨了三种类型化身状态指示器在响应生成期间的效果。我们的发现揭示了改进 LLM驱动对话系统响应性和真实性的设计考虑因素。我们详细描述了两种系统架构:一种使用 LLM 基于状态的机器人控制化身行为,另一种集成检索增强生成(RAG)以实现上下文驱动的响应。这些贡献为开发 VR 环境中的任务导向对话 AI 提供了实用见解。
引用
@article{arxiv.2501.00168,
title = {Takeaways from Applying LLM Capabilities to Multiple Conversational Avatars in a VR Pilot Study},
author = {Mykola Maslych and Christian Pumarada and Amirpouya Ghasemaghaei and Joseph J. LaViola},
journal= {arXiv preprint arXiv:2501.00168},
year = {2025}
}