面向低资源领域语言的语义搜索评估数据集自动收集
计算与语言
2024-12-16 v1
摘要
使用大量特定术语的领域特定语言常属于低资源语言类别。收集窄域测试数据集需要耗时且要求具备领域知识和训练才能完成标注任务的专业人力。本研究针对工业过程领域的低资源德语语料,解决自动收集语义搜索评估测试数据的挑战。我们的方案提出一种用于自动查询生成的端到端标注管道,以重新评估查询-文档对的得分。为克服缺乏在德语化学领域训练的文本编码器问题,我们探索了以众多“弱”文本编码器在常识数据集上训练的集成原则。我们结合来自不同模型的单个相关性得分,以检索文档候选和由LLM生成的相关性得分,旨在对查询-文档对齐达成共识。评估结果表明,集成方法在与人工指定的相关性得分一致性和准确性指标上显著优于单个模型。这些发现表明,集成学习能够有效地为特定、低资源语言的语义搜索系统提供适配,为领域特定情境下的资源限制提供了实用解决方案。
引用
@article{arxiv.2412.10008,
title = {Automated Collection of Evaluation Dataset for Semantic Search in Low-Resource Domain Language},
author = {Anastasia Zhukova and Christian E. Matt and Bela Gipp},
journal= {arXiv preprint arXiv:2412.10008},
year = {2024}
}
备注
accepted in the First Workshop on Language Models for Low-Resource Languages (LoResLM) co-located with the 31st International Conference on Computational Linguistics (COLING 2025)