中文

含能材料语料库主题建模中预测准确性与可解释性的权衡评估

计算与语言 2022-06-03 v1 机器学习

摘要

随着含能材料研究的数量与种类不断增加,基于机器的主题识别对于简化未来研究流程十分必要。自动主题识别过程的构成包括创建文档表示并执行分类。然而,将这些流程应用于含能材料研究会带来新的挑战。含能材料数据集包含许多科学术语,这些术语对于理解文档语境必不可少,但可能需要更复杂的文档表示。其次,分类所得预测必须能被流程中的化学家理解并信任。在本工作中,我们通过实现三种计算复杂度各异的文档嵌入方法来研究预测准确性与可解释性之间的权衡。结合准确性结果,我们还引入局部可解释模型无关解释(LIME)对每次预测进行说明,以提供对各个预测的局部理解,并与我们的含能材料专家团队一起验证分类器决策。本研究在一个由我们的含能材料专家团队创建并验证的新型标注含能材料数据集上开展。

关键词

引用

@article{arxiv.2206.00773,
  title  = {Assessing the trade-off between prediction accuracy and interpretability for topic modeling on energetic materials corpora},
  author = {Monica Puerto and Mason Kellett and Rodanthi Nikopoulou and Mark D. Fuge and Ruth Doherty and Peter W. Chung and Zois Boukouvalas},
  journal= {arXiv preprint arXiv:2206.00773},
  year   = {2022}
}

备注

Accepted for publication in the 25th International Seminar New Trends in Research of Energetic Materials (NTREM 2022 proceedings)