English

Multi-FAct: Assessing Factuality of Multilingual LLMs using FActScore

Computation and Language 2024-10-04 v3

Abstract

Evaluating the factuality of long-form large language model (LLM)-generated text is an important challenge. Recently there has been a surge of interest in factuality evaluation for English, but little is known about the factuality evaluation of multilingual LLMs, specially when it comes to long-form generation. %This paper systematically evaluates multilingual LLMs' factual accuracy across languages and geographic regions. We introduce a simple pipeline for multilingual factuality evaluation, by applying FActScore (Min et al., 2023) for diverse languages. In addition to evaluating multilingual factual generation, we evaluate the factual accuracy of long-form text generation in topics that reflect regional diversity. We also examine the feasibility of running the FActScore pipeline using non-English Wikipedia and provide comprehensive guidelines on multilingual factual evaluation for regionally diverse topics.

Keywords

Cite

@article{arxiv.2402.18045,
  title  = {Multi-FAct: Assessing Factuality of Multilingual LLMs using FActScore},
  author = {Sheikh Shafayat and Eunsu Kim and Juhyun Oh and Alice Oh},
  journal= {arXiv preprint arXiv:2402.18045},
  year   = {2024}
}
R2 v1 2026-06-28T15:02:48.640Z