迈向可保护隐私的大规模手语翻译
计算与语言
2024-08-09 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
数据稀缺是手语翻译(SLT)发展的主要障碍。当前网络上可获取的大部分手语数据由于缺乏对齐的字幕,无法用于训练监督模型。此外,利用大规模网络爬取数据集来扩展 SLT 存在隐私风险,因为其中包含生物特征信息,负责任的 SLT 技术开发应将其纳入考量。本文提出了一种用于大规模隐私感知型 SLT 的两阶段框架,同时应对上述两个问题。我们引入了 SSVP-SLT,它首先在经过匿名化处理且无标注的视频上进行自监督视频预训练,随后在经过精选的平行数据集上进行监督式 SLT 微调。SSVP-SLT 在 How2Sign 数据集上取得了最先进的微调及零样本无词形(gloss-free)SLT 性能,分别比相应最强基线高出超过 3 个 BLEU-4。基于受控实验,我们进一步讨论了自监督预训练以及通过面部模糊化实现匿名化对 SLT 的优势与局限。
引用
@article{arxiv.2402.09611,
title = {Towards Privacy-Aware Sign Language Translation at Scale},
author = {Phillip Rust and Bowen Shi and Skyler Wang and Necati Cihan Camgöz and Jean Maillard},
journal= {arXiv preprint arXiv:2402.09611},
year = {2024}
}
备注
ACL 2024