CICLe:面向大规模多类食品风险分类的共形上下文学习
计算与语言
2025-02-03 v3 机器学习
摘要
受污染或掺假的食品对人类健康构成重大风险。给定用于训练的带标签网络文本集,可以应用机器学习和自然语言处理来自动检测此类风险。我们发布了一个包含 7,546 条描述公共食品召回公告的短文本数据集。每条文本均在两个粒度级别(粗粒度和细粒度)上针对召回所对应的食品和危害进行了人工标注。我们描述了该数据集,并对朴素模型、传统模型和 Transformer 模型进行了基准测试。基于我们的分析,基于 tf-idf 表示的 Logistic Regression 在支持度低的类别上优于 RoBERTa 和 XLM-R。最后,我们讨论了不同的提示策略,并提出了一个基于共形预测的 LLM-in-the-loop 框架,该框架在提升基分类器性能的同时,相比正常提示降低了能耗。
关键词
引用
@article{arxiv.2403.11904,
title = {CICLe: Conformal In-Context Learning for Largescale Multi-Class Food Risk Classification},
author = {Korbinian Randl and John Pavlopoulos and Aron Henriksson and Tony Lindgren},
journal= {arXiv preprint arXiv:2403.11904},
year = {2025}
}