利用语料相似度度量预测低资源场景下的词嵌入可靠性
计算与语言
2022-06-10 v1
摘要
本文在 17 种语言上模拟低资源场景,以评估不同条件下词嵌入的相似性、稳定性与可靠性。目标是在训练前使用语料相似度度量来预测训练后词嵌入的性质。本文的主要贡献在于表明,利用上游语料相似度度量预测下游词嵌入相似性是可实现的。随后,通过建模由极有限训练数据所创建词嵌入的可靠性,将该发现应用于低资源场景。结果表明,使用在小规模数据上仍保持稳健的语料相似度度量来估计低资源词嵌入的可靠性是可行的。这些发现对于真正低资源语言的评估具有重要意义,因为此类语言因数据限制而无法使用这种系统性的下游验证方法。
引用
@article{arxiv.2206.04330,
title = {Predicting Embedding Reliability in Low-Resource Settings Using Corpus Similarity Measures},
author = {Jonathan Dunn and Haipeng Li and Damian Sastre},
journal= {arXiv preprint arXiv:2206.04330},
year = {2022}
}