中文

CABACE:注入字符序列信息与领域知识以增强首字母缩略词与展开形式抽取

计算与语言 2021-12-28 v1 人工智能 信息检索

摘要

首字母缩略词与展开形式常见于研究文档,在科学与法律领域文档中尤甚。此类文档中使用的许多缩略词具有领域特异性,极少出现于常规文本语料。因此,基于Transformer的NLP模型常将缩略词词元判为OOV(词汇表外),尤其对于非英语语言,其在抽取时关联缩略词与展开形式的性能受损。此外,BERT等预训练Transformer模型并非专为处理科学与法律文档而设计。基于上述总体动机,我们提出新框架CABACE:面向缩略词抽取的字符感知BERT,其考虑文本中字符序列,并通过掩码语言建模适配科学与法律领域。我们进一步采用带增广损失函数的目标,在标准交叉熵损失上添加最大损失与掩码损失项以训练CABACE。我们还利用伪标注与对抗数据生成提升框架泛化性。实验结果证明了该框架相较多种基线的优越性。此外,我们表明所提框架在非英语语言的零样本泛化上优于基线模型,从而印证了方法的有效性。我们的团队BacKGProp在SDU AAAI-22缩略词抽取(AE)共享任务的全球榜单上,于法语数据集取得最高分,丹麦语与越南语次之,英语法律数据集第三。

关键词

引用

@article{arxiv.2112.13237,
  title  = {CABACE: Injecting Character Sequence Information and Domain Knowledge for Enhanced Acronym and Long-Form Extraction},
  author = {Nithish Kannen and Divyanshu Sheth and Abhranil Chandra and Shubhraneel Pal},
  journal= {arXiv preprint arXiv:2112.13237},
  year   = {2021}
}