LOLA:基于大语言模型的在线学习算法用于内容实验
机器学习
2024-11-27 v3 机器学习
摘要
现代媒体公司需要自动高效的方法来识别最具吸引力和吸引力的内容。我们利用来自Upworthy(一家新闻出版社)的大规模数据集,包含17,681篇标题A/B测试,我们首先调查三种纯LLM方法识别最抓眼球的标题的能力:基于提示的方法、基于嵌入的方法和微调的开源LLM。基于提示的方法表现不佳,而OpenAI嵌入模型和微调的Llama-3-8B均略高于随机预测。总之,任何纯LLM方法都无法以高准确率预测最佳表现标题。随后,我们引入LLM辅助在线学习算法(LOLA),一种新型框架,将大语言模型(LLM)与自适应实验室结合以优化内容交付。LOLA将最佳纯LLM方法与Upper Confidence Bound算法结合,用于分配流量并自适应最大化点击。我们的在Upworthy数据上的数值实验表明,LOLA超越了标准A/B测试方法(Upworthy当前的事实标准)、纯bandit算法和纯LLM方法,尤其在实验流量有限的场景中表现突出。我们的方案可扩展,可应用于各种寻求优化用户参与度的场景,包括数字广告和社交媒体推荐。
引用
@article{arxiv.2406.02611,
title = {LOLA: LLM-Assisted Online Learning Algorithm for Content Experiments},
author = {Zikun Ye and Hema Yoganarasimhan and Yufeng Zheng},
journal= {arXiv preprint arXiv:2406.02611},
year = {2024}
}