中文

PREDICT:波斯语逆向词典

计算与语言 2021-11-02 v2 信息检索

摘要

寻找合适的词来表达概念(即词汇提取)对于有效沟通至关重要。逆向词典通过帮助人们找到与特定概念或想法相关的词来满足这一需求。据我们所知,这一资源在波斯语中尚不可用。在本文中,我们比较了四种用于实现波斯语逆向词典(PREDICT)的不同架构。我们使用从仅有的在线波斯语词典(即 Amid、Moein 和 Dehkhoda)中提取的(短语,词)元组来评估我们的模型,其中短语描述该词。给定短语,模型根据传达概念的能力建议最相关的词。如果正确的词在其顶部建议中,则认为模型表现良好。我们的实验表明,由长短期记忆(LSTM)单元并辅以加性注意力机制组成的模型足以产生与原始词典中的词相当(或在某些情况下优于)的建议。该研究还揭示,模型有时将其同义词作为输出,这促使我们引入一种用于评估逆向词典的新指标,称为同义词准确率(Synonym Accuracy),用于衡量产生该词或其同义词这一事件发生的百分比。使用这一新指标对最佳模型的评估还表明,至少 62% 的情况下,它在前 100 个建议中产生了准确结果。

关键词

引用

@article{arxiv.2105.00309,
  title  = {PREDICT: Persian Reverse Dictionary},
  author = {Arman Malekzadeh and Amin Gheibi and Ali Mohades},
  journal= {arXiv preprint arXiv:2105.00309},
  year   = {2021}
}