没有对话数据,怎么教AI聊天式推荐? 焦点热文

2026-09-15 22:31:39 科技行者

2016年前后,如果你想做一个能跟用户聊天推荐电影的AI系统,第一件要做的事就是去找一份对话数据集。


(资料图片)

这听起来理所当然,就像学做菜先要有食谱。但问题是,这份"食谱"极难获得。你需要成千上万条真实的人类对话,记录用户怎么描述自己想看的电影,系统又该怎么回应、怎么推荐。收集这些对话既要花钱雇人标注,又要担心隐私问题,很多平台的对话数据根本不允许拿去训练模型。

于是行业里出现了一个尴尬的死循环:想要好的对话推荐系统,就得先有对话数据;想收集对话数据,往往又需要一个已经能用的系统去跟真实用户互动。这篇来自加州大学圣地亚哥分校和Netflix的研究团队想问一个更直接的问题:能不能干脆绕开这个循环,不用任何对话数据,就把AI教会聊天式推荐?

**这篇论文给出的答案是:可以,只要你手里有商品评论、元数据和用户行为记录这些"非对话"信息,用大语言模型把它们转换成对话形式的训练数据。**

为什么直接甩给大模型不是好答案

你可能会说,现在大语言模型这么强,直接让它零样本推荐不就行了?

确实很多人这么做过,但直接部署一个大模型做推荐系统,麻烦不少。首先是成本,每次用户提问都要调用一次昂贵的云端大模型,量一大账单就爆炸。其次是这些黑箱模型的知识是固定在训练时刻的,行业里出了新电影新商品,它不知道。还有隐私问题,很多企业不愿意把用户数据直接传给外部的大模型服务。

**所以更现实的做法是,用大模型当"老师",离线生成一批训练数据,再拿这批数据去微调一个小一点、能自己部署管理的模型。**

这就好比你要培养一个新员工去接待客户,你不会让他每次接单都打电话问总部专家该怎么说,那样太慢太贵。更好的办法是先请一位资深顾问,把过去的客户反馈、产品手册整理成培训教材,让新员工提前学会怎么应答。资深顾问不用天天在场,新员工学会了就能独立上岗。这里的"资深顾问"就是负责生成数据的教师大模型,"新员工"就是最终部署的小模型。如果没有这套培训教材,新员工只能凭直觉瞎猜,效果自然差一大截。

这就引出了这项研究的核心设定,论文里管它叫"零数据对话推荐"。

零数据对话推荐系统:一种不依赖任何领域内对话语料的推荐系统构建方式,唯一可用的资源是商品评论、商品元数据、用户与商品的交互记录这类非对话信号。

三步走的自动化流水线

研究团队设计了一套三阶段流程:选择、生成、微调。

第一步是从海量的非对话种子数据里,挑出最有价值的样本。第二步是把挑出来的样本喂给教师大模型,让它生成模拟的用户提问和推荐答案。第三步是拿这批合成对话去微调目标模型。

这个流程里最有意思的地方是第一步的"挑选"。为什么不能随便挑?因为每让教师大模型生成一次对话都要花钱,如果预算有限,你肯定希望花在最有价值的样本上。

这就像你要办一场读书分享会,手头有一万本书,但只有预算请十位嘉宾来分享读后感。你会随便抽十本吗?大概不会。你可能会挑覆盖不同题材、不同风格的书,让分享会内容更丰富,也可能挑那些能引发最多讨论、信息量最大的书。如果随便乱抽,很可能抽到十本内容高度雷同的言情小说,分享会效果平庸。种子样本选择的道理完全一样,选得不好,教师模型生成再多对话也是低效重复。

研究团队用了两种选择策略,一种叫JS多样性,一种叫费雪信息。

JS多样性选择:一种主动学习策略,优先挑选那些和已选样本集合"长得不一样"的新样本,目标是让选出来的样本尽量覆盖整个数据分布的不同角落。

费雪信息选择:另一种主动学习策略,从参数优化的角度衡量每个样本能给模型训练带来多少"新信息量",倾向于挑选那些能让模型学到新东西、而不是重复已知内容的样本。

这两种策略代表了两种不同的哲学。JS多样性关心的是"覆盖面广不广",费雪信息关心的是"这个样本对模型训练到底有多大用"。论文里的实验发现,这两种策略各有胜负,具体谁更强要看数据集和预算大小,但共同点是它们都远远打赢了随机抽样和"挑评论最多的热门商品"这种简单粗暴的策略。这一点其实有点反直觉,你可能会觉得热门商品的评论信息量更大,应该更值得学,但实验结果显示,只挑热门商品有时候还不如随机抽样,因为热门商品彼此之间往往长得很像,学了十个头部商品和学了一个头部商品带来的信息增量差不了多少。

生成对话:从评论碎片到用户提问

选好样本之后,怎么变成对话?

研究团队让教师大模型先从若干条真实商品评论里提炼信息,模仿从Reddit电影讨论区收集来的真实提问风格,生成一个听起来很自然的用户提问,比如"我最近看了一部把经典神话故事讲出新意思的电影,还有没有类似的推荐"。然后再让大模型针对这个提问,生成20个候选推荐商品作为参考答案。

这个设计有个细节值得注意,为什么要生成20个候选而不是1个?因为真实世界里,一个用户提问往往对应多个合理的答案,规定死一个标准答案反而会让模型学得过于死板,缺乏应对多样化真实需求的灵活性。这就像老师批改作文题,如果只给一个"标准范文",学生很容易学成模板化写作,但如果给出二十篇不同角度但都合格的范文,学生反而能学到更灵活的表达方式。

生成完的数据质量怎么样?研究团队专门找了两位研究生对100条随机抽取的问答对打分,从自然度、连贯性、相关性、多样性四个维度评分,满分5分,平均分都接近4分。有个挺意外的发现,那些"照本宣科"生成的对照组数据(不用任何领域信号,直接让GPT-4o瞎编)里的电影标题反而更符合真实电影目录,命中率高达92.3%,而真正用领域信号生成的数据只有76.5%的命中率。但下游效果却是领域信号生成的数据完胜。这说明了一个道理,标题对不对不重要,重要的是这个训练样本对模型学习有没有真正的营养价值,就像一份菜谱写得排版工整、用词考究,不代表照着做出来的菜真的好吃。

效果验证:小模型逆袭

那么这套流水线到底管不管用?

论文在两个标准测试集ReDial和INSPIRED上做了系统对比,涵盖了从15亿参数到40亿参数的多个模型规模。

**结果显示,用领域信号生成的合成数据训练出来的模型,全面碾压零样本提示和无脑瞎生成的对照组。**

具体数字挺震撼的。在INSPIRED数据集上,Qwen2.5这个15亿参数的小模型,经过全参数微调后,第一名命中率(Recall@1)相比零样本提升了207.8%,而用无脑瞎生成数据训练的对照组只提升了18.8%。这十倍多的差距说明,光是让大模型多写点文本没用,关键是这些文本有没有扎根在真实的领域信息里。

还有个挺有意思的现象,小模型从这套方法里获益更多。15亿参数的Qwen2.5相对提升41.8%,而40亿参数的Qwen3只提升了18.3%。这多少有点像给学生补课,基础薄弱的学生上了强化课程,进步空间更大,本来底子就厚的学生,边际收益自然要小一些。

微调方式上,全参数微调普遍比低秩适配(一种只调整模型一小部分参数的省资源微调方式)效果更好,尤其是在小模型上差距明显。

LoRA微调:一种参数高效的微调技术,只更新模型里一小部分低秩矩阵参数,而不是把整个模型的所有参数都重新训练一遍,好处是省显存省时间,代价是有时候调整能力不如全参数微调彻底。

更让人意外的是,这套流水线不只对大语言模型有效。研究团队还测试了一个传统的、非语言模型架构的推荐系统NBCRS,把它在原始种子数据上训练和在合成对话数据上训练做对比,结果合成数据训练出来的效果暴涨,Recall@5从0.39飙升到11.52。这证明了一个更根本的道理,把非对话信号转换成对话格式这件事本身就有价值,跟用什么模型架构去消化这些数据没有必然关系。

多种领域信号,各自扮演什么角色

商品评论只是众多信息源里的一种,研究团队还测试了加入商品元数据(描述、类型、分类)和协同过滤信号(用户历史交互模式)之后,选择质量会不会进一步提升。

结果是两者都有用,而且作用机制不太一样。

元数据带来的是结构性覆盖的提升,随着预算增大,加了元数据的选择策略优势越来越明显。这可以理解成,评论文本告诉你用户对一个商品的主观感受,但元数据能告诉你这个商品客观上属于什么类型、什么分类,两者互补,一个讲"喜不喜欢",一个讲"是什么"。

协同过滤信号则带来了另一种维度的信息,用户实际的交互历史反映出真实的偏好结构,这种信息是评论文本和元数据都覆盍不到的。就像你想了解一个人喜欢什么电影,光看他写的影评(评论信号)和看他买的碟片种类(元数据)还不够,你还得看他实际反复看了哪些电影、跳过了哪些(协同过滤信号),这才是最接近真实偏好的信号。

合成数据和真实数据的关系:不是替代,是补位

最后一个问题最实际:如果手头已经有一点点真实对话数据,合成数据还有没有用?

答案挺清楚。在数据特别稀缺的场景下(比如INSPIRED数据集只有1000条对话),单纯用合成数据训练出来的模型,效果反而超过了用这1000条真实数据训练出来的模型。而当把合成数据和真实数据混在一起训练,效果又能进一步提升。

**但在数据相对充裕的ReDial数据集(一万条对话)上,加入合成数据反而轻微拉低了效果。**

这个反差揭示了一件事:合成数据的价值曲线不是线性的,它在真实数据稀缺时价值最大,一旦真实数据本身已经足够丰富,合成数据的边际贡献甚至可能变成负数,因为合成数据毕竟不是真实用户产生的,混入太多可能引入一些细微的分布偏差。

这就好比补习班存在的意义,对一个基础薄弱的学生,请家教补课效果显著;但对一个已经门门功课优秀的学生,硬塞补习班课程未必有帮助,甚至可能因为占用时间、打乱节奏反而拖累成绩。合成数据就是这个"补习班",用得恰到好处才有价值,滥用反而适得其反。

写在后面

读完这篇论文,我一直在想一个问题:整个方法论里最巧妙的地方,其实不是"用大模型生成数据"这件事本身,因为这已经不算新鲜了。真正让我意外的是主动选择这一步的必要性被证明得这么扎实,研究者专门验证了"挑评论最多的热门商品"这种最朴素、最符合直觉的做法,反而经常输给随机抽样。这提醒我们,在很多需要"选出最有价值的东西"的场景里,人的直觉往往是有偏的,热门不等于有用,显眼不等于重要。

还有一个细节值得单独说,论文里提到用无脑瞎生成的数据训练出来的电影标题,反而比精心设计的领域grounded方法更符合真实电影目录。这个发现某种意义上是在提醒我们,衡量一份训练数据好不好,不能只看它表面上"像不像真的",得看它训练出来的模型到底能不能用。这跟教育领域里的一个老问题很像,一份考卷答得规规矩矩、格式完美,不代表这个学生真的理解了知识。

这套方法目前只在电影推荐这一个领域里跑通,音乐、电商这些领域会不会一样有效,论文自己也承认还没验证。但这条思路本身,用非对话的原始业务数据把AI教会对话能力,或许能给很多缺少对话语料却坐拥海量业务数据的行业一个新的思路。

Q&A

Q1:零数据对话推荐系统是什么意思?

A:指在完全没有真实对话语料的情况下,仅利用商品评论、元数据和用户交互记录这类非对话信号,通过大语言模型生成合成对话数据来训练推荐系统的方法。

Q2:合成对话数据真的能比真实对话数据效果更好吗?

A:在真实对话数据非常稀缺的场景下确实可以,论文实验显示在仅有1000条对话的INSPIRED数据集上,纯合成数据训练效果超过了真实数据训练,但在数据充裕的场景下合成数据的帮助会减弱甚至轻微拖累效果。

Q3:为什么挑选评论最多的热门商品做种子数据反而效果不好?

A:因为热门商品之间往往内容高度相似,信息增量有限,实验发现这种热度优先的挑选方式有时甚至不如随机抽样,而基于多样性和信息量的主动选择策略效果明显更优。

上一篇 : 每日短讯:一箭十星 中国民营火箭首次承担大型卫星互联网星座组网任务

下一篇 : 最后一页

相关推荐