Imagen是Google Research Brain团队推出的文本到图像扩散模型。它以前所未有的照片级真实感和深层次的语义理解能力闻名,核心发现是:在文生图任务中,增大文本编码语言模型(如T5)的规模比增大图像扩散模型更能提升画面保真度和图文对齐度。Imagen在COCO数据集上取得了7.27的零样本FID得分(FID越低越好),人类评分者认为其样本在图文对齐方面与真实COCO数据不相上下。
技术核心:语言模型驱动的图像生成
Imagen的关键创新在于利用大型语言模型(T5)进行文本编码。传统文生图方法通常使用CLIP等对比学习模型,而Imagen证明了纯文本预训练的通用LLM在编码文本进行图像合成方面出奇有效。更大的T5模型带来更精准的语义理解和更高质量的图像生成——增加T5的规模对性能的提升远大于增加扩散模型的规模。
DrawBench评测基准
Imagen团队引入了DrawBench——一个全面且具有挑战性的文生图基准测试,用于深入评估模型的文本理解能力。通过与VQ-GAN+CLIP、Latent Diffusion Models和DALL-E 2等方法的对比,Imagen在人类评分者的并排比较中在样本质量和图文对齐方面均被偏好。
Imagen家族扩展
Imagen已发展为一个模型家族:Imagen Video(视频生成)、Imagen Editor(图像编辑)。这标志着Google在AI视觉生成领域从静态图像向动态视频和交互编辑方向的扩展。
开源与研究状态
Imagen是Google Research的学术研究项目,论文可通过arXiv获取。但需注意,Google未公开发布Imagen的可商用模型权重,该工具更多作为学术研究参考和技术路线指引。
常见问题
Imagen能免费使用吗? 这是研究项目而非公开产品,Google未提供公开的API或Demo入口。
Imagen和Stable Diffusion有什么区别? Imagen使用T5作为文本编码器,SD使用CLIP;Imagen是学术项目,SD是开源社区产品。
FID 7.27是什么意思? FID(Fréchet Inception Distance)是衡量图像生成质量的指标,数值越低越好,7.27在发布时创下纪录。
Imagen Video能做什么? 这是Imagen从图像生成扩展到视频生成的版本,详情见Google Research项目页。
论文在哪里可以看? 论文发表于arXiv (2205.11487),所有技术细节均可公开获取。