中文

面向混合模态语料的统一多模态标点恢复框架

计算与语言 2022-02-02 v1 人工智能

摘要

标点恢复任务旨在为自动语音识别系统的输出转写文本正确添加标点。以往的标点模型要么仅使用文本,要么需要对应的音频,往往受限于真实场景——未加标点的句子是带音频与不带音频句子的混合体。本文提出一种名为 UniPunc 的统一多模态标点恢复框架,以单一模型对混合句子进行标点恢复。UniPunc 在共享潜在空间中联合表示带音频与不带音频的样本,模型据此学习混合表示并对两类样本进行标点恢复。我们在真实世界数据集上验证了 UniPunc 的有效性,其总体 F1 分数至少超越 BERT、MuSe 等多种强基线 0.8,达到了新的 SOTA。大量实验表明,UniPunc 的设计是一种通用解决方案:通过嫁接至已有模型,UniPunc 使它们能够在混合语料上进行标点恢复。我们的代码已发布于 github.com/Yaoming95/UniPunc。

关键词

引用

@article{arxiv.2202.00468,
  title  = {Unified Multimodal Punctuation Restoration Framework for Mixed-Modality Corpus},
  author = {Yaoming Zhu and Liwei Wu and Shanbo Cheng and Mingxuan Wang},
  journal= {arXiv preprint arXiv:2202.00468},
  year   = {2022}
}

备注

5 pages, accepted by ICASSP'2022