中文

利用领域特定语言模型与数据增强方法检测 ESG 主题

计算与语言 2020-10-19 v1 信息检索 机器学习

摘要

尽管基于深度学习的语言建模近期取得进展,金融领域许多自然语言处理(NLP)任务仍因缺乏适当标注数据而具挑战性。可能限制任务性能的其他问题包括:通常用于预训练语言模型的一般语料库与金融语料库之间的词分布差异,后者常表现出专门的语言与符号。本文研究两种可能有助于缓解这些问题的方法。首先,我们使用来自商业与金融新闻的大量领域内数据进行了进一步的语言模型预训练实验。随后应用增强方法以增大用于模型微调的数据集规模。我们在一个环境、社会与治理(ESG)争议数据集上报告了发现,并证明两种方法均有益于分类任务的准确率。

关键词

引用

@article{arxiv.2010.08319,
  title  = {Detecting ESG topics using domain-specific language models and data augmentation approaches},
  author = {Tim Nugent and Nicole Stelea and Jochen L. Leidner},
  journal= {arXiv preprint arXiv:2010.08319},
  year   = {2020}
}

备注

11 pages, 5 tables, 1 figure