中文

结合对比学习与知识图谱嵌入开发意大利语医学词嵌入

计算与语言 2022-11-10 v1 机器学习

摘要

词嵌入在当今自然语言处理任务与应用中发挥着重要作用。虽然预训练模型可直接采用并集成到现有流程中,但它们常需微调以更好地适配特定语言或领域。本文尝试通过结合对比学习(CL)与知识图谱嵌入(KGE),在尚未被覆盖的意大利语医学领域这一空白中改进现有嵌入。主要目标是提升医学术语间语义相似度的准确性,该任务亦用作评测任务。由于意大利语缺乏医学文本与受控词表,我们通过结合已有的 CL 方法(多相似度损失、上下文化、动态采样)与 KGE 的集成,创造了损失函数的新变体,从而开发了特定解决方案。尽管未能超越以多语言模型为代表的当前最优(SOTA),所得结果令人鼓舞:相较于初始模型取得了显著的性能飞跃,同时使用了显著更少的数据量。

关键词

引用

@article{arxiv.2211.05035,
  title  = {Combining Contrastive Learning and Knowledge Graph Embeddings to develop medical word embeddings for the Italian language},
  author = {Denys Amore Bondarenko and Roger Ferrod and Luigi Di Caro},
  journal= {arXiv preprint arXiv:2211.05035},
  year   = {2022}
}