中文

从科学论文中自动提取缩写-展开对的研究

计算与语言 2024-12-03 v1 信息检索

摘要

本项目解决了数字文本中广泛使用缩写和缩写词带来的挑战。我们提出一种新方法, 组合文档预处理、正则表达式和大型语言模型来识别缩写并将其映射到相应的展开形式。正则表达式单独往往不足以提取展开形式, 此时我们的方法利用 GPT-4 分析缩写周围的文本。通过限制仅对周围文本的小部分进行分析, 我们缓解了获取错误或多个展开形式的风险。处理包含缩写的文本存在若干已知挑战, 包括多义缩写、非局部和模糊缩写。我们的做法通过自动化缩写识别和消歧来提高 NLP 技术的精度和效率。本研究突显了处理 PDF 文件的挑战以及文档预处理的重要性。此外, 本研究结果表明, 正则表达式和 GPT-4 单独都无法表现良好。正则表达式适用于识别缩写, 但在发现其展开形式时存在局限, 由于用于表达缩写-展开对的多种格式以及作者倾向于在文本中省略展开形式。GPT-4 则是获取展开形式的优秀工具, 但在正确识别所有相关缩写方面存在挑战。此外, GPT-4 由于其概率性质, 可能导致相同输入产生略有不同的结果。我们的算法采用预处理以消除文本中的无关信息, 使用正则表达式识别缩写, 并利用大型语言模型帮助查找缩写展开形式, 以提供最准确和一致的结果。

关键词

引用

@article{arxiv.2412.01093,
  title  = {Automated Extraction of Acronym-Expansion Pairs from Scientific Papers},
  author = {Izhar Ali and Million Haileyesus and Serhiy Hnatyshyn and Jan-Lucas Ott and Vasil Hnatyshin},
  journal= {arXiv preprint arXiv:2412.01093},
  year   = {2024}
}

备注

9 pages, 1 figure