TalkLoRA:面向语音驱动动画的低秩适配
计算机视觉与模式识别
2024-08-27 v1
摘要
语音驱动面部动画对于包括电视、电影、视频游戏、通信和 AR/VR 在内的许多应用至关重要。最近,变压器被证明在此任务中效果极佳。然而,我们确定了现有基于变压器的模型存在两个问题:首先,它们难以适应新的个人化说话风格,其次由于变压器的二次复杂度,它们在长句子上运行较慢。我们提出了 TalkLoRA 以解决这两个问题。TalkLoRA 使用低秩适配 (Low-Rank Adaptation) 通过为每个受试者训练一个仅包含少量参数的适配器,有效且高效地适应新的说话风格,即使数据有限亦可。我们还采用分块策略来降低底层变压器的复杂度,使其在推理时能够处理长句子。TalkLoRA 可应用于任何基于变压器的语音驱动动画方法。我们进行了大量实验,表明 TalkLoRA 在风格适应方面实现了最新水平,并且在不牺牲质量的前提下,推理时间可实现数量级的复杂度降低。我们还研究并提供了关于 LoRA 微调语音驱动面部动画模型的超参数选择的见解。
引用
@article{arxiv.2408.13714,
title = {TalkLoRA: Low-Rank Adaptation for Speech-Driven Animation},
author = {Jack Saunders and Vinay Namboodiri},
journal= {arXiv preprint arXiv:2408.13714},
year = {2024}
}