中文

ChatAnything:基于LLM增强角色的面对面聊天

计算机视觉与模式识别 2023-11-14 v1 人工智能

摘要

在本技术报告中,我们旨在以在线方式为基于LLM的角色生成拟人化角色,包括视觉外观、性格与语调,且仅需文本描述。为此,我们首先利用LLM的上下文学习能力,通过精心设计的系统提示集实现性格生成。随后提出两个新概念:用于多样语音与外观生成的混合声音(MoV)与混合扩散器(MoD)。对于MoV,我们利用具有多种预定义语调的文本转语音(TTS)算法,并基于用户提供的文本描述自动选择最匹配者。对于MoD,我们结合近期流行的文本生图技术与说话头算法,简化说话物体生成流程。我们将整体框架称为ChatAnything。借助它,用户仅需少量文本输入即可为任何事物赋予拟人化角色并动起来。然而,我们观察到当前生成模型产出的拟人化物体常无法被预训练人脸关键点检测器识别,导致人脸运动生成失败,即便这些面孔具人类般外观,因为此类图像在训练中几乎未见(例如OOD样本)。为解决此问题,我们在图像生成阶段引入像素级引导以注入人脸关键点。为基准化这些指标,我们构建了评估数据集。基于此,我们验证人脸关键点检测率从57.0%显著提升至92.5%,从而允许基于生成语音内容自动人脸动画。代码与更多结果见https://chatanything.github.io/。

关键词

引用

@article{arxiv.2311.06772,
  title  = {ChatAnything: Facetime Chat with LLM-Enhanced Personas},
  author = {Yilin Zhao and Xinbin Yuan and Shanghua Gao and Zhijie Lin and Qibin Hou and Jiashi Feng and Daquan Zhou},
  journal= {arXiv preprint arXiv:2311.06772},
  year   = {2023}
}