中文

建筑延期争议文件审查中的文本分类情境下嵌入模型实证评估

信息检索 2025-01-20 v1

摘要

文本嵌入是将文本数据转换为实数向量的数值表示方法,能够捕捉文本元素在连续向量空间中的语义含义和关系。文本嵌入的主要目标是使机器学习模型能够处理文本数据,这些模型需要数值输入。本文通过对四种不同嵌入模型进行全面比较分析,评估其在文本分类效能方面的表现。我们采用K近邻(KNN)和逻辑回归(LR)进行二分类任务,具体判断文本片段是否与"延期"相关。我们的研究探索了使用文本片段嵌入训练监督文本分类模型,以识别建筑延期争议文件审查过程中与延期相关陈述的能力。该研究的结果表明,嵌入模型有潜力提高法律情境下文档分析的效率和准确性,为复杂调查场景中的更明智决策铺平了道路。

关键词

引用

@article{arxiv.2501.09859,
  title  = {Empirical Evaluation of Embedding Models in the Context of Text Classification in Document Review in Construction Delay Disputes},
  author = {Fusheng Wei and Robert Neary and Han Qin and Qiang Mao and Jianping Zhang},
  journal= {arXiv preprint arXiv:2501.09859},
  year   = {2025}
}