中文

HAMLET:面向医疗保健的自适应多语言学习嵌入式主题模型

计算与语言 2025-05-13 v1

摘要

传统主题模型往往难以处理上下文细微差别,无法充分处理多义性和稀有词。这一局限通常导致主题缺乏连贯性和质量。大型语言模型(LLM)可以通过生成初始主题集合来缓解这一问题。然而,这些原始主题经常缺乏精炼和代表性,导致冗余且缺乏词汇相似性,降低可解释性。本文介绍HAMLET,这是一种基于图的跨语言医疗保健主题建模架构,利用LLM。该方法利用神经网络增强的语义融合来细化LLM生成主题的嵌入。本方法不依赖仅靠统计共现或人类解释来从文档语料库中提取主题,而是引入一种主题嵌入细化技术,利用双向编码器表示变换器(BERT)和图神经网络(GNN)。在主题生成之后,采用BERT和Sentence-BERT(SBERT)的混合技术进行嵌入。主题表征进一步通过GNN进行细化,该网络在文档、主题、词汇、相似主题和相似词之间建立联系。引入一种新方法来计算相似性。因此,主题嵌入被细化,提取出前k个主题。实验使用两个医疗保健数据集进行了测试,一个为英文,一个为法文,衍生出六套数据集。结果表明HAMLET有效。

关键词

引用

@article{arxiv.2505.07157,
  title  = {HAMLET: Healthcare-focused Adaptive Multilingual Learning Embedding-based Topic Modeling},
  author = {Hajar Sakai and Sarah S. Lam},
  journal= {arXiv preprint arXiv:2505.07157},
  year   = {2025}
}