ID-LoRA:基于In-Context LoRA的面向身份驱动的音视频个性化
声音
2026-03-12 v1 计算机视觉与模式识别
图形学
摘要
现有的视频个性化方法保留视觉外观,但将视频和音频 treated separately。没有对视觉场景的访问,音频模型无法与屏幕上的动作同步声音;而由于经典语音克隆模型仅以参考录音为条件,文本提示无法引导说话风格或声学环境。我们提出ID-LoRA(Identity-Driven In-Context LoRA),联合生成受试者的外观和声音,让文本提示、参考图像和短音频片段共同控制两种模态。ID-LoRA通过参数高效的In-Context LoRA适配LTX-2联合音视频扩散主干模型,据我们所知是首种在单一生成 passes 中对视觉外观和声音进行个性化的方法。出现两个挑战。参考token和生成token共享相同的positional-encoding空间,使其难以区分;我们通过负temporal位置来解决此问题,将参考token置于互斥的RoPE区域,同时保持其内部temporal结构。说话者特征在denoising期间也容易被稀释;我们引入身份引导,这是一种classifier-free guidance变体,通过对比带和不带参考信号的预测来放大说话者特定特征。在人类偏好研究中,ID-LoRA在语音相似度和说话风格上分别被73%和65%的标注者优于Kling 2.6 Pro。在跨环境设置下,说话者相似度比Kling提高了24%,差距在条件越偏离时会进一步扩大。一项初步的用户研究进一步表明,联合生成为物理驱动的声音合成提供了有用的归纳偏置。ID-LoRA仅需约3K训练对即可在单张GPU上实现。代码、模型和数据将公开释放。
引用
@article{arxiv.2603.10256,
title = {ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA},
author = {Aviad Dahan and Moran Yanuka and Noa Kraicer and Lior Wolf and Raja Giryes},
journal= {arXiv preprint arXiv:2603.10256},
year = {2026}
}