Kyrgyz 词向量评估数据集 HJ-Ky-0.1
计算与语言
2024-12-02 v2
摘要
现代应用计算语言学的关键任务之一是构建单词向量表示(词嵌入),这些表示广泛用于情感分析、信息抽取等自然语言处理任务。要选择合适的方法来生成这些词嵌入,通常需要质量评估技术。标准方法涉及计算具有专家评估相似度的单词向量之间的距离。这项工作介绍了第一个针对 Kyrgyz 语言的“银标准”数据集,同时训练相应的模型并通过质量评估指标验证了数据集的适用性。
引用
@article{arxiv.2411.10724,
title = {HJ-Ky-0.1: an Evaluation Dataset for Kyrgyz Word Embeddings},
author = {Anton Alekseev and Gulnara Kabaeva},
journal= {arXiv preprint arXiv:2411.10724},
year = {2024}
}
备注
The translation of the 2023 paper into English