中文

基于 NLP 与 LLM 的经济研究论文标题去重技术评估

计算与语言 2025-07-02 v3 人工智能

摘要

本研究探讨了针对大型 NLP 数据集的经济研究论文标题进行高效去重技术。我们探索了各种配对方法,以及 established distance measures(如 Levenshtein 距离、余弦相似度)和 sBERT 模型用于语义评估。我们的发现表明,基于所观察到的不同方法之间的语义相似度,重复项的出现率可能较低。进一步的以人工标注的 ground truth 数据集进行探索,以获得更为结论性的评估。结果支持来自 NLP、LLM 基于距离的度量方法的发现。

关键词

引用

@article{arxiv.2410.01141,
  title  = {Evaluating Deduplication Techniques for Economic Research Paper Titles with a Focus on Semantic Similarity using NLP and LLMs},
  author = {Doohee You and S Fraiberger},
  journal= {arXiv preprint arXiv:2410.01141},
  year   = {2025}
}

备注

6 pages, 1 figure