基于代码的英文模型在中文问答对抽取任务上的惊人表现
计算与语言
2024-03-12 v3 人工智能
摘要
在先前的研究中,基于代码的模型在推理密集型场景中一直优于基于文本的模型。在为检索增强生成(RAG)生成知识库时,我们观察到基于代码的模型在中文问答对抽取任务中也表现得异常出色。此外,我们的实验以及我们设计的指标发现,包含一定量中文数据的基于代码的模型能取得更好的性能。另外,基于代码的英文模型在特定中文任务中的能力,为讨论哲学上的“中文房间”思想实验提供了独特的视角。
引用
@article{arxiv.2401.10286,
title = {Code-Based English Models Surprising Performance on Chinese QA Pair Extraction Task},
author = {Linghan Zheng and Hui Liu and Xiaojun Lin and Jiayuan Dong and Yue Sheng and Gang Shi and Zhiwei Liu and Hongwei Chen},
journal= {arXiv preprint arXiv:2401.10286},
year = {2024}
}