缩小规模,OpenAI文本生成图像新模型_编码机介绍

当前位置： 编码机 >> 编码机介绍 >> 缩小规模,OpenAI文本生成图像新模型

缩小规模,OpenAI文本生成图像新模型

发布时间:2024/12/4 13:09:26

北京中科医院是假的吗 http://www.txbyjgh.com/axhd/m/1350.html

机器之心报道

编辑：陈萍、小舟

模型的参数规模并不需要那么大。

从年初OpenAI刷屏社区的DALL-E到英伟达生成逼真摄影的GauGAN2，文本生成图像可谓是今年大火的一个研究方向。现在OpenAI又有了新的进展——35亿参数的新模型GLIDE。

如下图1所示，GLIDE通常会生成逼真的阴影和反射，以及高质量的纹理。此外，该模型还能够组合多个概念（例如柯基犬、领结和生日帽），同时将属性（例如颜色）绑定到这些对象。

除了从文本生成图像，GLIDE还有图像编辑功能——使用文本prompt修改现有图像，在必要时插入新对象、阴影和反射，如下图2所示。例如，在草坪上添加斑马：

如下图3所示，GLIDE的零样本生成和修复复杂场景的能力也很强。

GLIDE还能够将草图转换为逼真的图像编辑。例如下图中「一只戴着领结和生日帽的柯基犬」从涂鸦草图转换成了逼真的图像。

上述功能是怎样实现的呢？在新模型GLIDE中，OpenAI将指导扩散（guideddiffusion）应用于文本生成图像的问题。首先该研究训练了一个35亿参数的扩散模型，使用文本编码器以自然语言描述为条件，然后比较了两种指导扩散模型至文本prompt的方法：CLIP指导和无分类器指导。通过人工和自动评估，该研究发现无分类器指导能够产生更高质量的图像。

论文

转载请注明:http://www.aideyishus.com/lkyy/7312.html

------分隔线----------------------------

上一篇文章：电脑PIN码忘记了电脑就只能变砖几个方法
下一篇文章：华为全惠轻三大系列摄像机上市,超级编码方

热点文章

BampWPI7突破真无线耳机的功能

缩小规模,OpenAI文本生成图像新模型

最新文章

热点文章

推荐文章