中文

一种面向标点恢复的情景感知特征融合框架

计算与语言 2022-04-12 v1 声音 音频与语音处理

摘要

为完成标点恢复任务,大多数现有方法侧重于利用额外信息(如词性标注)或解决类不平衡问题。近期工作已广泛采用基于 transformer 的语言模型并显著提升了效果。据我们所知,一个固有被忽视的问题是:在输入较长的无标点语句时,transformer 中各个注意力头的注意力会被稀释或失效。由于那些先前的上下文(而非后续内容)对当前位置更有价值,仅靠独立注意力难以取得良好平衡。本文中,我们提出一种基于两类注意力(FFA)的新颖特征融合框架以缓解该不足。它引入了双流架构。一个模块涉及注意力头之间的交互以促进沟通,另一掩码注意力模块捕获依赖特征表示。随后,它聚合两种特征嵌入以融合信息并增强情景感知。在流行基准数据集 IWSLT 上的实验表明我们的方法有效。无需额外数据,它取得了与当前最先进(SOTA)模型相当的性能。

关键词

引用

@article{arxiv.2203.12487,
  title  = {A Context-Aware Feature Fusion Framework for Punctuation Restoration},
  author = {Yangjun Wu and Kebin Fang and Yao Zhao},
  journal= {arXiv preprint arXiv:2203.12487},
  year   = {2022}
}