![](https://cdn.jiqizhixin.com/assets/code-modal__close-c158a550a9982aa92801c046548d72945aa912de6f2a012513132fdc02dfc379.png)
Auto Byte
专注未来出行及智能汽车科技
![](https://cdn.jiqizhixin.com/assets/auto-byte__qr-code-89b58c6d2398c12b7def0f2538cac5ff08727062918f9bad97f25b1d61aac000.png)
微信扫一扫获取更多资讯
![](https://cdn.jiqizhixin.com/assets/code-modal__close-c158a550a9982aa92801c046548d72945aa912de6f2a012513132fdc02dfc379.png)
Science AI
关注人工智能与其他前沿技术、基础学科的交叉研究与融合发展
![](https://cdn.jiqizhixin.com/assets/science-ai__qr-code-a12e4635c8d3968645bd2b6371981b65b0d21058c5a2c216aef80015b4eb7e43.png)
微信扫一扫获取更多资讯
加上Web UI,文本-图像模型Stable Diffusion变身绘图工具,生成艺术大片
前段时间,来自慕尼黑大学和 Runway 的研究者,与Eleuther AI、LAION 等团队合作,共同开发了一种文本转图像模型 Stable Diffusion。这项研究入选CVPR 2022 Oral。
Stable Diffusion 可以在消费级 GPU 上的 10 GB VRAM 下运行,并在几秒钟内生成 512x512 像素的图像,无需预处理和后处理。
Stable Diffusion的生成效果是这样的。宇宙的演变:![图片](https://image.jiqizhixin.com/uploads/editor/947ea9c3-ee45-42ff-a9be-be148c389630/640.gif)
![图片](https://image.jiqizhixin.com/uploads/editor/f188a671-f3a3-41e5-abfa-028803ec84ce/640.gif)
这成片质量妥妥达到了大片级别。试想一下,如果将Stable Diffusion的作图功能发展成为一种绘画工具,将其与Web UI相结合,会带来怎样的设计体验。现在,有这样一个项目,可以满足广大研究者的需求。
- 项目地址:https://github.com/hlky/stable-diffusion
- Docker镜像:https://github.com/AbdBarho/stable-diffusion-webui-docker
有了这个项目,没有系统学习UI知识的小伙伴,也可以上手操作。例如自己动手设计城堡,并且周围环境按自己喜好来设计:![图片](https://image.jiqizhixin.com/uploads/editor/bbfbdd6d-96bc-464b-9870-26b93a525e09/640.gif)
在城堡外面安排一名侍卫,并让一位骑马的战士奔向城堡:![图片](https://image.jiqizhixin.com/uploads/editor/1dff3e57-1279-4df7-a99a-666dc72d68cf/640.gif)
![图片](https://image.jiqizhixin.com/uploads/editor/d1828b2c-2c34-434d-90d2-2b5b656f4cad/640.gif)
不过想要实现上述效果,还需要Gradio库,这是一个免费、开源的Python库,它允许用户为机器学习模型开发易于使用的可定制组件演示,还可以帮助用户构建一个可以互动的网络应用。
不过带有Gradio UI的原始脚本是由一位匿名用户编写的,现在该项目进行了一些修改:借助这一项目,用户不再需要手动输入参数,需要做的是编写提示并调整滑块就可以了,其强大的设计工具,还可用于重新生成要更改的图像的特定部分,并且生成的图像失真少、质量还高。
该库还内置了GFPGAN选项,不到半秒就能修复失真人脸;此外还内置了RealESRGAN选项,用来提高图像的分辨率。对于Stable Diffusion的这一应用,众多网友表示「赞极了」。对于它的应用前景,更有人预测称,「未来几年用它做专辑封面将会变得更加疯狂。」不过也有持相反意见的,认为「这是该技术对艺术家和插图画家有害的典型例子,他们不用付出太多天赋和努力就能生成不可思议的艺术图像。不过未来仍需要艺术家,只要他们将自己的风格融入到这些模型中。」还有些网友认为,文本转图像有点像语言翻译领域正在经历的事情。借助机器学习模型生成的译文质量不一,然后译者对译文进行润色编辑。而由于生成的图像具有各种各样的伪影,艺术家们可能要做更多的修饰工作。