低资源语言上基于块处理的文本嵌入评估策略
计算与语言
2026-05-22 v1
摘要
本研究比较了四种文本块处理方法:Recursive、Khmer-Aware、Sentence-Based 和 LLM-Based 在用于 Khmer 农业文档的检索增强生成(RAG)框架中的性能。文档块使用 BGE-M3 多语言嵌入模型进行编码,并使用 FAISS 库进行检索。采用四个指标进行性能评估:平均检索得分(L2 距离)、答案相关性、Khmer 覆盖率和 Khmer 交并比,所有指标均针对真实问题-答案对进行测量。进行 5 折交叉验证,涵盖 18 个问题-答案对。我们观察到基于字符的 Recursive 块处理方法在块大小为 300 个字符时表现最佳,实现了最低的 L2 距离(0.4295 ± 0.0461)、最高的答案相关性(0.8663 ± 0.0199)和最高的 Khmer IoU(0.6441 ± 0.0347)。配对 t 检验显示其在 L2 距离上相对于 Sentence-Based 块处理方法具有统计显著改进(p = 0.0121)。这些结果凸显了在形态复杂的低资源语言如 Khmer 中优化稠密检索所需的分段粒度和结构保持的重要性。
引用
@article{arxiv.2605.22203,
title = {Evaluation of Chunking Strategies for Effective Text Embedding in Low-Resource Language on Agricultural Documents},
author = {Sovandara Chhoun and Pichdara Po and Sereiwathna Ros and Wan-Sup Cho and Saksonita Khoeurn},
journal= {arXiv preprint arXiv:2605.22203},
year = {2026}
}
备注
11 pages, 1 figure