为 Stable Diffusion 提供浏览器图形界面,把文生图、图生图、修复与放大等操作集中到可交互的网页中,降低使用门槛。
这个工具是什么
Stable Diffusion web UI 是 AUTOMATIC1111 维护的开源项目,用 Gradio 库为 Stable Diffusion 实现网页界面,主要语言为 Python,采用 AGPL-3.0 许可证。它把扩散模型的推理流程封装成表单式操作,用户无需编写代码即可完成图像生成与编辑。README 列出 txt2img、img2img、Outpainting、Inpainting、Color Sketch、Prompt Matrix、Upscale 等模式,并集成 GFPGAN、CodeFormer、RealESRGAN、ESRGAN、SwinIR、Swin2SR、LDSR 等修复与放大组件。项目还提供一键安装运行脚本,但仍需自行安装 Python 与 git。
核心能力
- 提供 txt2img 与 img2img 两种基础生成模式,并支持 Outpainting、Inpainting 与 Color Sketch 等编辑操作
- 支持 Attention 语法、Prompt Matrix、Prompt Editing、Composable-Diffusion 与 Negative prompt 等提示词控制方式
- Extras 标签集成 GFPGAN、CodeFormer、RealESRGAN、ESRGAN、SwinIR、Swin2SR、LDSR 等修复与放大工具
- 生成参数随图像保存,可拖回 PNG Info 标签还原,并支持 X/Y/Z plot、Loopback、Checkpoint Merger 等实验功能
科研中的典型用法
- 用 txt2img 按提示词批量生成图像,并通过 X/Y/Z plot 对比不同参数组合下的输出差异
- 用 img2img 配合 Inpainting、Outpainting 对已有图像做局部重绘或向外扩展,用于素材修补与构图延展
- 用 Extras 中的 GFPGAN、CodeFormer 修复人脸,或用 RealESRGAN、ESRGAN、SwinIR 等对图像做超分辨率放大
快速上手
需先安装 Python 与 git,再克隆仓库并运行一键启动脚本(Linux/macOS 为 webui.sh,Windows 为 webui-user.bat)。首次运行会自动下载依赖与模型,随后在浏览器打开本地地址即可使用。README 提到 4GB 显存可运行,也有 2GB 可用的报告;可在设置页调整默认值,启用 --allow-code 后可从界面运行任意 Python 代码。
生态与相近工具
同领域还有 ComfyUI、InvokeAI、Fooocus 等基于扩散模型的界面,以及 diffusers 等库。Stable Diffusion web UI 的特点是功能覆盖面广、社区扩展脚本多,适合需要大量参数调节与批量实验的用户;若偏好节点式流程或更轻量的交互,可考虑其他方案。README 提到可通过 Custom Scripts 接入社区扩展。
项目信息
- 仓库:AUTOMATIC1111/stable-diffusion-webui
- 星标:165,020 · 派生:31,080
- 主要语言:Python
- 许可证:AGPL-3.0
- 最近提交:2026-03-02
本文属于《学科研究工具知识库 · 人工智能》第 2 篇(按 GitHub 星标排序)。收录标准:该学科公开可获取的开源研究工具,星标与活跃度为主要参考,不代表对其性能或适用性的背书;选型前请结合自身场景评估。

发表评论 取消回复