DiffSign:基于AI的可定制化手语视频生成方法
计算机视觉与模式识别
2024-12-06 v1
摘要
近年来,随着多种流媒体服务的普及,全球不同观众现在能够观看同一项媒体内容,如电影或电视剧。尽管正在添加翻译和配音服务以使内容更易于当地观众理解,但对使内容更易于不同能力者(如聋力及听力受损人群,DHH)访问的支持仍滞后于需求。我们的目标是通过生成逼真且有表现力的手语视频,使媒体内容更易于DHH社区访问。由于为特定媒体内容使用的同一名手语译者在全球范围内可能受限于吸引力,因此我们的方法结合了参数化建模和生成式建模,以生成逼真的合成手语译者并根据用户偏好定制其外观。我们首先通过优化参数化模型将人类手语姿势定向到3D手语化身。然后,将高保真姿势的渲染化身用于条件化生成式模型生成的合成手语译者的姿势。通过通过视觉适配器提供的图像提示来控制合成手语译者的外观。我们的结果表明,使用我们的方法生成的手语视频在时间一致性和逼真度方面优于仅基于文本提示的扩散模型生成的手语视频。我们还支持多模态提示,允许用户进一步定制译者的外观以适应多样性(例如肤色、性别)。我们的方法也对于手语译者匿名化有用。
引用
@article{arxiv.2412.03878,
title = {DiffSign: AI-Assisted Generation of Customizable Sign Language Videos With Enhanced Realism},
author = {Sudha Krishnamurthy and Vimal Bhat and Abhinav Jain},
journal= {arXiv preprint arXiv:2412.03878},
year = {2024}
}
备注
Published in Proceedings of ECCV, Workshop on Assistive Computer Vision and Robotics, 2024