面向生物医学领域的稀疏可解释词嵌入评估
计算与语言
2020-05-12 v1 机器学习
摘要
词嵌入已广泛应用于包括生物医学领域在内的各种自然语言处理任务中。虽然这些向量表示成功捕捉了语义和句法词关系以及数据中的隐藏模式和趋势,但它们无法提供可解释性。可解释性是论证的关键手段,在生物医学应用中不可或缺。我们提出了一项关于医学领域词嵌入可解释性的综合研究,重点关注稀疏方法的作用。提供了用于词向量表示可解释性的定性和定量测量与指标。对于定量评估,我们引入了一个广泛的分类数据集,可用于基于范畴理论量化可解释性。还给出了所研究方法的内部和外部评估。对于后者,我们提出了可用于生物医学领域词向量有效外部评估的数据集。根据我们的实验,可以看出稀疏词向量在保持原始向量在下游任务中性能的同时,展现出远更强的可解释性。
引用
@article{arxiv.2005.05114,
title = {Evaluating Sparse Interpretable Word Embeddings for Biomedical Domain},
author = {Mohammad Amin Samadi and Mohammad Sadegh Akhondzadeh and Sayed Jalal Zahabi and Mohammad Hossein Manshaei and Zeinab Maleki and Payman Adibi},
journal= {arXiv preprint arXiv:2005.05114},
year = {2020}
}