中文

面向维基百科和维基数据问答的无误差知识获取:基于问题到问题检索的方法

计算与语言 2025-02-24 v3 人工智能

摘要

本文提出一种用于知识库(如维基百科和维基数据)上的问答方法,通过进行"问题到问题"匹配和检索来实现。我们不直接嵌入文档内容,而是生成每个逻辑内容单元的综合问题集合,这些问题使用指令调校型大语言模型生成。这些问题被向量嵌入并存储,映射到相应的内容。用户查询的向量嵌入随后与此问题向量存储库进行匹配。最高的相似度得分导致直接检索相关文章内容,无需生成答案。该方法实现了超过0.9的高余弦相似度,实现了高度精确的检索。该方法具有计算效率高、响应迅速和可扩展性强等多项优势。我们在维基百科和维基数据上Demonstrated其有效性,包括通过从维基数据检索结构化事实来处理多媒体内容,为多模态问答开辟了新的路径。

关键词

引用

@article{arxiv.2501.11301,
  title  = {Question-to-Question Retrieval for Hallucination-Free Knowledge Access: An Approach for Wikipedia and Wikidata Question Answering},
  author = {Santhosh Thottingal},
  journal= {arXiv preprint arXiv:2501.11301},
  year   = {2025}
}