中文

跨语言法律文档检索:基于同义词集的主题层次

信息检索 2019-12-02 v1 数字图书馆

摘要

立法文本的多语言标注使我们能够探索多语言法律数据中所涵盖的主要主题,并且是在搜索相似文档时语义相似性的关键促进因素。多语言概率主题模型最近作为一组半监督机器学习模型出现,可用于对多种语言文本集合进行主题探索。然而,这些方法需要主题对齐的训练数据来创建语言无关空间,这限制了该技术可用的场景数量。在本工作中,我们提供一种无监督的文档相似度算法,基于多语言概念的层次来描述跨语言主题。该算法不需要平行语料或可比语料,也不需要任何其他类型的翻译资源。在 JCR-Acquis 语料库的英语、西班牙语、法语和葡萄牙语版本上进行的实验,在按相似内容对文档进行分类和排序方面显示出有前景的结果。

关键词

引用

@article{arxiv.1911.12637,
  title  = {Legal document retrieval across languages: topic hierarchies based on synsets},
  author = {Carlos Badenes-Olmedo and Jose-Luis Redondo-Garcia and Oscar Corcho},
  journal= {arXiv preprint arXiv:1911.12637},
  year   = {2019}
}

备注

IberLegal Workshop co-located with Jurix 2019