ConvFill:用于响应式对话式语音代理的模型协作
计算与语言
2025-11-11 v1
摘要
部署带有大语言模型的对话式语音代理面临一个关键挑战:云端基础模型提供深层推理和领域知识,但引入延迟会破坏自然对话;而本地模型则能立即响应,但缺乏 sophistication。我们提出了对话式填充任务,即轻量级本地模型在 seamlessly 整合来自强大后端模型的流式知识的同时生成情境上恰当的对话。这种方法将响应延迟与模型能力解耦,使能够感觉上响应迅速,同时访问大规模模型的全部能力。我们提出了 ConvFill,一个训练了 3600 万参数的模型,基于合成多领域对话进行训练。实验表明,对话式填充可以被成功学习,ConvFill 在与多个后端模型相关的评估中,相对于相同尺寸的独立小模型实现了 36-42% 的准确率提升,同时始终保持亚 200ms 的响应延迟。我们的结果表明,这种方法为构建同时即时响应且有知识的本地对话式代理提供了潜力。
引用
@article{arxiv.2511.07397,
title = {ConvFill: Model Collaboration for Responsive Conversational Voice Agents},
author = {Vidya Srinivas and Zachary Englhardt and Maximus Powers and Shwetak Patel and Vikram Iyer},
journal= {arXiv preprint arXiv:2511.07397},
year = {2025}
}