主页 > 快资讯 > 正文

谷歌复用30年前经典算法，CV引入强化学习，网友：视觉RLHF要来了？(2)

2023-02-27 19:36来源：未知编辑：admin

扫一扫

分享文章到微信

扫一扫

关注99科技网微信公众号

复制网址

图源：https://twitter.com/johnjnay/status/1627009121378598912

奖励

在不丧失泛化性的情况下，该研究将 CV 任务描述为学习一个函数的过程，该函数将输入 x（即图像）映射到输出 y = [y_1, y_1，……， y_n]（文本 token 序列、bounding box 序列等）。该研究旨在学习以 θ 为参数的条件分布 P (y|x， θ)，使奖励函数 R 最大化。用抽象的公式来形容，就是本文要解决以下优化问题。问题有了，接下来就是怎么解决了，本文分两步走：首先用最大似然估计对模型进行预训练；然后使用 REINFORCE 算法对模型进行 Tuning 。下面我们看看这两步的具体过程：最大似然预训练首先使用最大似然原理估计参数 θ 并捕获训练数据的分布。实现这一目标可采用梯度下降算法，该算法通过最大化训练数据的 log-likelihood 来实现。算法 1 和图 2 描述了 MLE（最大似然估计）优化步骤，这是训练模型最常用的方法。完成这一步将得到 MLE 模型。 REINFORC 算法将奖励最大化为了更好的优化 MLE 模型以适应任务风险，还需要最大化奖励函数。对于给定输入 x，该研究利用 REINFORCE 算法来估计对给定 x 期望奖励的梯度，公式如下所述：算法 2 提供了伪代码，图 3 说明了该过程：

实验结果

接下来我们看看本文提出的方法在视觉任务上的表现。全景分割如下表 1 所示，Tuning 过程显著改善了 MLE 模型。视觉检查（visual inspection）后的结果表明，Tuning 后的模型在避免不连贯预测方面更好，特别是对于小尺度物体，可参见图 1。目标检测表 2 显示，通过优化，该研究将原始 MLE 模型的 mAP 分数从 39.2% 大幅提高到 54.3%。在 Pix2seq 中，具有稍大的 1333×1333 分辨率和许多启发式的相同大小的 ViT-B 模型达到了 47.1%。当使用更大的 ViT-L 主干时，Pix2seq 报告的最佳目标检测结果为 50.0%。上色图 4 给出的定性结果清楚地表明，新模型始终能产生更丰富多彩的图像。图像描述表 3 结果表明，应用所提出的方法可以改进 MLE 模型，这与先前文献中的观察结果一致，证明了该方法针对特定任务风险进行 tuning 的有效性。

99科技网：http://www.99it.com.cn

共3页:
上一页
1
2
3
下一页

相关推荐

百度、谷歌接连官宣，还有多少ChatGPT竞品在路上?
ChatGPT 的竞品们要来了。

快资讯2023-02-08

ChatGPT全面引爆AI搜索大战！美银：谷歌具有更大竞争优势
随着AI之战全面打响，微软公司则在周二推出了新的人工智能搜索引擎必应（

快资讯2023-02-08

5天注册用户超100万，ChatGPT让谷歌百度坐不住了
对搜索引擎领域的绝对头部企业来说，不是一个好消息。

快资讯2023-02-08

谷歌seo优化公司外贸建站数聚梨整站谷歌优化方案
搜索引擎是如今大家在互联网使用中最常用,同时也是最重要的功能。而谷歌,被

快资讯2022-11-20

「扩散模型」首篇综述+论文分类汇总，谷歌&北大最新研究
最近爆火的“ 扩散模型（diffusion model）”首篇综述来了。

快资讯2022-09-19

谷歌、MIT「迭代共同认证」视频问答模型：SOTA性能，算力少用80%
谷歌、MIT联合研究，视频问答模型计算效率提升一倍。

快资讯2022-09-15

谷歌用新AI超越自己：让Imagen能够指定生成对象，风格还能随意转换
给Imagen加上“指哪打哪”的能力，会变得有多强？

快资讯2022-09-15

Yann LeCun开怼谷歌研究：目标传播早就有了，你们创新在哪里？
在昨日的学术圈，图灵奖得主Yann LeCun对谷歌的一项研究发起了质疑。

快资讯2022-08-30

谷歌团队推出新Transformer，优化全景分割方案｜CVPR 2022
语义分割就比如为图像中的每个像素分配语义标签，例如「人」和「天空」。

快资讯2022-08-30

谷歌华人研究员发布MobileNeRF，渲染3D模型速度提升10倍
神经辐射场横空出世，只需几张2D的静态图像，即可合成出该模型的3D场景表示

快资讯2022-08-30

头条资讯

元宇宙概念为何爆发，互联网技术枯竭

音乐对顾客心理的影响

县级加盟什么店挣钱？

加盟雪丰建材需要什么条件？

未来经济发展的趋势？

推荐资讯

火力全开-Precision 7670触顶性能天花版

win7系统应用程序提示0x00000010错误怎么解决方法

OPPO,Vivo,华为，小米，哪个手机和智能手表更胜一筹？

在小县城开一家什么店比较赚钱?

在县城，做什么项目能挣大钱？

最近更新

如何看待比特币NFT？｜疑问解答

那些DeFi 和NFT 钻石手们都在用什么工具挖掘Web3机会？

科普 | 以太坊智能合约的ERC标准是什么？

ETH质押龙头项目，Lido Finance价值几何？

大网区块链BigtangleBlockchain（十）