中文

特征工程与深度学习在论文章节识别中的对比:面向中文医学文献的应用

计算与语言 2024-12-17 v1 机器学习

摘要

章节识别是图书馆学,特别是知识管理中的一项重要任务。识别论文的章节有助于过滤实体和关系提取中的噪声。在本研究中,我们研究了中文医学文献分析背景下的论文章节识别问题,其中从医生角度看,主题、方法和结果更有价值。基于先前关于英文文献章节识别的研究,我们实验了与经典机器学习算法一起使用的有效特征来解决该问题。发现考虑句子相互依赖性的条件随机场在结合不同特征集(如词袋、词性和标题)进行中文文献章节识别时更为有效。此外,我们发现经典机器学习算法在此问题上比通用深度学习模型更有效。基于这些观察,我们设计了一种新颖的深度学习模型——结构双向长短期记忆(SLSTM)模型,该模型将词和句子的相互依赖性与上下文信息一起建模。在人工标注的哮喘文献数据集上的实验表明,我们的方法优于传统机器学习方法和其他深度学习方法,在该任务中实现了接近90%的精确率和召回率。该模型显示出在其他文本挖掘任务中应用的潜力。本研究具有重要的方法论和实践意义。

关键词

引用

@article{arxiv.2412.11125,
  title  = {Feature engineering vs. deep learning for paper section identification: Toward applications in Chinese medical literature},
  author = {Sijia Zhou and Xin Li},
  journal= {arXiv preprint arXiv:2412.11125},
  year   = {2024}
}