主页 > 快资讯 > 正文

ChatGPT会取代搜索引擎吗??(2)

2023-02-23 11:58来源:未知编辑:admin

扫一扫

分享文章到微信

扫一扫

关注99科技网微信公众号

ChatGPT:第二阶段

第二阶段:训练回报模型(Reward Model,RM)。这个阶段的主要目的是通过人工标注训练数据,来训练回报模型。具体而言,随机抽样一批用户提交的prompt(大部分和第一阶段的相同),使用第一阶段Fine-tune好的冷启动模型,对于每个prompt,由冷启动模型生成K个不同的回答,于是模型产生出了<prompt,answer1>,<prompt,answer2>….<prompt,answerK>数据。之后,标注人员对K个结果按照很多标准(上面提到的相关性、富含信息性、有害信息等诸多标准)综合考虑进行排序,给出K个结果的排名顺序,这就是此阶段人工标注的数据。

接下来,我们准备利用这个排序结果数据来训练回报模型,采取的训练模式其实就是平常经常用到的pair-wise learning to rank。对于K个排序结果,两两组合,形成 (k2)" role="presentation">

(

k

2

)

个训练数据对,ChatGPT采取pair-wise loss来训练Reward Model。RM模型接受一个输入<prompt,answer>,给出评价回答质量高低的回报分数Score。对于一对训练数据<answer1,answer2>,我们假设人工排序中answer1排在answer2前面,那么Loss函数则鼓励RM模型对<prompt,answer1>的打分要比<prompt,answer2>的打分要高。

归纳下:在这个阶段里,首先由冷启动后的监督策略模型为每个prompt产生K个结果,人工根据结果质量由高到低排序,以此作为训练数据,通过pair-wise learning to rank模式来训练回报模型。对于学好的RM模型来说,输入<prompt,answer>,输出结果的质量得分,得分越高说明产生的回答质量越高。

chatGPT:第三阶段

第三阶段:采用强化学习来增强预训练模型的能力。本阶段无需人工标注数据,而是利用上一阶段学好的RM模型,靠RM打分结果来更新预训练模型参数。具体而言,首先,从用户提交的prompt里随机采样一批新的命令(指的是和第一第二阶段不同的新的prompt,这个其实是很重要的,对于提升LLM模型理解instruct指令的泛化能力很有帮助),且由冷启动模型来初始化PPO模型的参数。然后,对于随机抽取的prompt,使用PPO模型生成回答answer, 并用上一阶段训练好的RM模型给出answer质量评估的回报分数score,这个回报分数就是RM赋予给整个回答(由单词序列构成)的整体reward。有了单词序列的最终回报,就可以把每个单词看作一个时间步,把reward由后往前依次传递,由此产生的策略梯度可以更新PPO模型参数。这是标准的强化学习过程,目的是训练LLM产生高reward的答案,也即是产生符合RM标准的高质量回答。

99科技网:http://www.99it.com.cn

相关推荐
从ChatGPT看AI如何赋能降本增效 从ChatGPT看AI如何赋能降本增效

数字化发展的深入,促使大多数金融机构已经构建了客户标签体系用于个性化运

快资讯2023-02-23

“ChatGPT综合征”:搞钱、失业焦虑、技术争论 “ChatGPT综合征”:搞钱、失业焦虑、技术争论

“ChatGPT综合征”:依赖、对立、焦虑、兴奋。

快资讯2023-02-23

百度、谷歌接连官宣,还有多少ChatGPT竞品在路上? 百度、谷歌接连官宣,还有多少ChatGPT竞品在路上?

ChatGPT 的竞品们要来了。

快资讯2023-02-08

ChatGPT能替代胡锡进吗? ChatGPT能替代胡锡进吗?

再不蹭ChatGPT的热度,就晚了——万一下个「革命性技术」又来了呢。

快资讯2023-02-08

ChatGPT爆火,带来哪些机会? ChatGPT爆火,带来哪些机会?

ChatGPT这把火,正烧得越来越旺!

快资讯2023-02-08

用了ChatGPT后,我发现离不开它了 用了ChatGPT后,我发现离不开它了

伴随全球科技巨头微软的一笔大额投资,ChatGPT爆火出圈,成为时下AI圈新晋“顶

快资讯2023-02-08

ChatGPT Prompt工程:设计、实践与思考 ChatGPT Prompt工程:设计、实践与思考

ChatGPT 火爆出圈了,有些人惊叹于它的能力,当然也有部分人觉得也就那样。

快资讯2023-02-08

ChatGPT全面引爆AI搜索大战!美银:谷歌具有更大竞争优势 ChatGPT全面引爆AI搜索大战!美银:谷歌具有更大竞争优势

随着AI之战全面打响,微软公司则在周二推出了新的人工智能搜索引擎必应(

快资讯2023-02-08

虚拟偶像狂吻ChatGPT,提线木偶装上脑子,会怎样 虚拟偶像狂吻ChatGPT,提线木偶装上脑子,会怎样

ChatGPT的这一幕,去年此刻也曾经上演过。

快资讯2023-02-08

科大讯飞能成为中国版ChatGPT吗 科大讯飞能成为中国版ChatGPT吗

摆在科大讯飞面前一个更残酷的事实是,随着头部互联网大厂的入局,人工智能

快资讯2023-02-08