中文

评估大语言模型嗅觉感知能力的基准

计算与语言 2026-04-02 v1 人工智能

摘要

我们介绍了嗅觉感知(Olfactory Perception, OP)基准测试,旨在评估大语言模型(LLM)对嗅觉推理的能力。该基准包含1010个问题,涵盖八个任务类别:气味分类、气味初级描述符识别、强度和愉悦性判断、多描述符预测、混合物相似性、嗅觉受体激活以及来自真实气味来源的嗅觉识别。每个问题以两种提示格式呈现——化合物名称和等立体构型SMILES——以评估分子表征的影响。我们评估了21种模型配置,发现化合物名称提示在所有模型家族中均优于等立体构型SMILES,提升幅度从+2.4个百分点到+18.9个百分点(平均约+7个百分点),表明当前大语言模型主要通过词汇关联来获取嗅觉知识,而非结构化分子推理。最佳模型达到64.4%的总体准确率,既显示出新兴能力,又凸显了嗅觉推理中的显著不足。我们进一步在21种语言中评估了OP子集,发现跨语言聚合预测可提升嗅觉预测性能,最佳语言集成模型的AUROC为0.86。大语言模型应能够处理嗅觉信息,而不仅仅是视觉或听觉信息。

关键词

引用

@article{arxiv.2604.00002,
  title  = {Benchmark for Assessing Olfactory Perception of Large Language Models},
  author = {Eftychia Makri and Nikolaos Nakis and Laura Sisson and Gigi Minsky and Leandros Tassiulas and Vahid Satarifard and Nicholas A. Christakis},
  journal= {arXiv preprint arXiv:2604.00002},
  year   = {2026}
}