面向危机相关社交媒体文本的语义增强跨语言句嵌入
计算与语言
2024-03-26 v1
摘要
诸如语义搜索和聚类等任务在危机相关社交媒体文本上的应用,增强了我们对危机话语的理解,有助于决策和针对性干预。预训练语言模型提升了危机信息学的性能,但其上下文嵌入缺乏语义意义。尽管 CrisisTransformers 系列包含一个句子编码器以解决语义性问题,但它仍是单语的,仅处理英语文本。此外,为不同语言使用独立模型会导致嵌入位于不同的向量空间,在比较多语言文本间的语义相似度时带来挑战。因此,我们提出了多语言句子编码器(CT-XLMR-SE 和 CT-mBERT-SE),能够为超过 50 种语言的危机相关社交媒体文本生成嵌入,使得无论语言差异如何,具有相似含义的文本在同一向量空间中彼此靠近。在句子编码和句子匹配任务上的结果令人鼓舞,表明这些模型可作为嵌入多语言危机相关社交媒体文本的稳健基线。模型已公开发布于:https://huggingface.co/crisistransformers。
引用
@article{arxiv.2403.16614,
title = {Semantically Enriched Cross-Lingual Sentence Embeddings for Crisis-related Social Media Texts},
author = {Rabindra Lamsal and Maria Rodriguez Read and Shanika Karunasekera},
journal= {arXiv preprint arXiv:2403.16614},
year = {2024}
}
备注
Accepted to ISCRAM 2024