面向音频去标识化的命名实体识别
声音
2022-04-28 v1 密码学与安全
音频与语音处理
摘要
数据匿名化通常是一项由人工完成的任务。将其自动化将降低完成此任务所需的成本和时间。本文提出了一种用于自动化法语音频数据匿名化的流水线。我们提出的流水线接收音频文件及其转录文本,并移除音频中存在的命名实体 (NEs)。我们的流水线由一个强制对齐器(将音频转录文本中的单词与语音对齐)和一个执行命名实体识别 (NER) 的模型组成。然后,与命名实体对应的音频片段被替换为静音,以实现音频匿名化。我们比较了强制对齐器和 NER 模型,以找到最适合我们场景的组合。我们在一个小型手工标注数据集上评估了我们的流水线,取得了 0.769 的 F1 分数。这一结果表明,自动化此任务是可行的。
引用
@article{arxiv.2204.12622,
title = {Named Entity Recognition for Audio De-Identification},
author = {Guillaume Baril and Patrick Cardinal and Alessandro Lameiras Koerich},
journal= {arXiv preprint arXiv:2204.12622},
year = {2022}
}
备注
8 pages