基于词嵌入的文本地质推断
计算与语言
2025-04-11 v1 统计方法学
摘要
本研究探索利用自然语言处理(NLP)技术定位地质资源,特别聚焦于工业矿物。通过使用由 GloVe 模型训练的词嵌入,我们提取目标关键词与地质文本语料库之间的语义关系。文本经过过滤,仅保留具有地理意义的词(如城市名),然后按其与目标关键词的余弦相似度进行排序。我们应用降维技术(包括主成分分析(PCA)、自编码器、变分自编码器(VAE)以及结合长短期记忆的 VAE(VAE-LSTM))来增强特征提取并提升语义关系的准确性。作为基准,我们使用 haversine 公式计算与目标关键词语义最相关的十个城市与已识别矿点之间的距离。结果表明,将 NLP 与降维技术相结合可为自然资源的空间分布提供有价值的洞见。尽管结果显示其与假定位置处于同一区域,但精度仍有提升空间。
引用
@article{arxiv.2504.07490,
title = {Geological Inference from Textual Data using Word Embeddings},
author = {Nanmanas Linphrachaya and Irving Gómez-Méndez and Adil Siripatana},
journal= {arXiv preprint arXiv:2504.07490},
year = {2025}
}