通过词嵌入的类比任务预测药物-基因关系
计算与语言
2025-05-28 v5
摘要
自然语言处理(NLP)被广泛应用于各个领域,其中文本中的单词通常被转换为称为嵌入的特征向量。BioConceptVec是专门为生物学定制的嵌入示例,使用skip-gram等模型在约3000万篇PubMed摘要上训练而成。通常,词嵌入已知可以通过简单的向量算术解决类比任务。例如,从king的向量中减去man的向量,然后加上woman的向量,得到的点在嵌入空间中更接近queen。在本研究中,我们证明了BioConceptVec嵌入以及我们自己在PubMed摘要上训练的嵌入包含药物-基因关系的信息,并且可以通过类比计算从给定药物预测靶基因。我们还表明,使用生物通路对药物和基因进行分类可以提高性能。此外,我们证明了来自过去已知关系的向量可以预测按年份划分的数据集中未知的未来关系。尽管将类比任务实现为向量加法很简单,但我们的方法在预测药物-基因关系方面表现出与GPT-4等大型语言模型相当的性能。
引用
@article{arxiv.2406.00984,
title = {Predicting drug-gene relations via analogy tasks with word embeddings},
author = {Hiroaki Yamagiwa and Ryoma Hashimoto and Kiwamu Arakane and Ken Murakami and Shou Soeda and Momose Oyama and Yihua Zhu and Mariko Okada and Hidetoshi Shimodaira},
journal= {arXiv preprint arXiv:2406.00984},
year = {2025}
}