嘿,朋友。先把那些晦涩难懂的技术论文放一放,我知道你点开这篇文章,大概率是看着朋友圈或者Instagram上那些惊艳的AI画作,心里既兴奋又有点犯嘀咕:“这东西真的我能学会吗?”
答案是:能,而且比你想象的要简单得多。
但这里有个大坑,很多人只学到了“画图”,却没学到“驾驭”。今天我不跟你扯什么大模型底层架构,咱们直接聊怎么用最顺手的方式,画出你想要的东西,同时——这点最重要——怎么保护你自己的钱袋子和法律风险。
第一阶段:理解“魔法”的本质,别被术语吓跑
在动手之前,我得先帮你把两个概念掰开揉碎,因为这是你后面所有操作的基石。
Midjourney (MJ) 和 Stable Diffusion (SD) 本质上都是“文生图”模型。通俗点说,它们是一台超级聪明的“翻译机”。你给它一堆文字(提示词),它负责把这些文字翻译成像素点。
区别在哪里?
- Midjourney 像是去高端画廊请了一位天才画家。你只需要描述你想看什么,它画出来的东西,默认审美就很高,光影、构图往往一出手就是大片。它的门槛极低,但控制权也相对弱,你想让画家把左手改一下,没那么容易。
- Stable Diffusion 像是你开了一家自己的印刷厂,并且拥有所有的画笔和颜料。你需要自己买设备(显卡或云端),需要学习更复杂的操作界面,但你可以精准控制每一根头发的走向、每一个角落的光线,而且版权完全归你。
如果你只是想“玩票”,MJ够用;如果你想“吃饭”或者“深度创作”,SD是必经之路。
第二阶段:Midjourney —— 零基础的最优解
MJ是目前最容易上手的工具。你不需要懂Python,不需要配置环境,只需要你会聊天。
1. 在哪里玩?
去 Discord。对,就是那个聊天软件。加入Midjourney的官方服务器(或者使用其他集成Bot)。
2. 提示词怎么写?(MJ的语法)
MJ的提示词结构其实很简单,就是一场描述性对话。
核心公式:
[主体描述] + [环境/背景] + [艺术风格] + [光影/色调] + [比例参数]
举个实战例子: 假设你想画“一个赛博朋克风格的少女,在雨中”。
初级写法(不推荐):
cyberpunk girl rain后果: 画面可能很杂乱,少女长得像个外星人。进阶写法(推荐):
A cinematic shot of a young cyberpunk girl standing in the rain, neon lights reflecting on her face, raindrops on her trench coat, futuristic Tokyo background, bokeh effect, 8k, highly detailed, realistic --ar 16:9 --stylize 250
拆解一下其中的门道:
- Cinematic shot:电影镜头感,这是MJ的隐藏热词,加了它,画面马上有质感。
- Neon lights reflecting on her face:具体到细节的描述,比单纯说“赛博朋克”更有用。
- Bokeh effect:背景虚化,突出主体。
- –ar 16:9:这是MJ的专属参数,意思是“宽屏比例”,像电影一样。如果不加,默认是正方形,很多壁纸需求会被这个卡住。
- –stylize 250:控制MJ的艺术发挥程度。数值越低(如100),越忠实于你的提示词;数值越高(如1000),MJ会发挥更多艺术想象力,但可能偏离你的原意。新手建议设在250-500之间。
3. MJ的“微调”神器:V和U
生成4张图后,你会看到下方有 V1, V2, V3, V4 和 U1, U2, U3, U4。
- U (Upscale):放大并高清化某一张图。选你最喜欢的那张点U。
- V (Vary):基于这张图,重新生成4张类似的变体。如果U完图觉得某个细节不够好,可以点V让它微调。
4. 进阶技巧:局部重绘 (Inpainting)
这是MJ最厉害的地方之一。你画好了一张图,但觉得手画错了,或者眼镜没加上去。
- 点那张图的
...菜单,选择 Vary (Region)。 - 用画笔涂抹你想修改的区域(比如只涂手部)。
- 在提示词框里输入具体的修改指令,比如
holding a coffee cup, realistic hand。 - 提交,它只会修改涂抹的区域,其他地方保持不变。
注意: 这是付费用户的功能。免费试用期只有几百分钟,够你体验,但想商用,准备好钱包。
第三阶段:Stable Diffusion —— 掌控一切的开始
如果说MJ是“点菜”,那SD就是“自己做饭”。你需要一台配置不错的电脑(NVIDIA显卡,显存至少8G,推荐12G以上),或者租用云端算力(如AutoDL、阿里云等,新手友好的平台)。
1. 安装与启动
对于新手,强烈不建议直接从GitHub下载源码自己配置Python环境(除非你是程序员)。直接使用整合包:
- 秋叶整合包(国内最流行):中文界面,一键启动,自带大量模型和工具。
- WebUI (Automatic1111):全球通用的标准界面,教程最多。
- ComfyUI:节点式工作流,上限极高,但学习曲线陡峭,适合进阶。
新手起步: 下载秋叶整合包,解压,双击启动。看到界面了?恭喜,你已经跨过了90%的人。
2. 模型(Checkpoint)—— SD的灵魂
MJ是固定的,但SD可以换“皮肤”。这些皮肤就是大模型。
- ChilloutMix:人像写实类的王者,亚洲脸模非常自然。
- DreamShaper:综合能力强,画风偏艺术,适合各种题材。
- Realistic Vision:极致写实,皮肤纹理、毛孔都清晰可见。
- RevAnimated:动漫风格的首选。
哪里下载? 去 Civitai (C站) 或 Hugging Face。C站是全球最大的SD模型社区,上面有无数大神分享的模型和LoRA。
3. 提示词的正向与负向
SD和MJ最大的不同在于:你有两个框,一个正向,一个负向。
- 正向提示词 (Positive Prompt):你想要什么。
- 负向提示词 (Negative Prompt):你不想要什么。
为什么负向提示词这么重要? 因为AI默认会犯很多错误,比如手指畸形、多长手臂、模糊不清。你把它写进负向提示词,它就有了“黑名单”。
通用的负向提示词模板(直接复制):
nsfw, lowres, bad anatomy, bad hands, text, error, missing fingers, extra digit, fewer digits, cropped, worst quality, low quality, normal quality, jpeg artifacts, signature, watermark, username, blurry
实战例子: 还是画“赛博朋克少女雨中”。
- 正向:
1girl, cyberpunk, rain, neon lights, trench coat, detailed face, masterpiece, best quality, 8k, photorealistic, cinematic lighting - 负向:
bad anatomy, bad hands, missing fingers, extra digit, fewer digits, cropped, worst quality, low quality, blurry, nsfw
关键点: 中文和英文都能用,但英文模型对英文提示词的理解精度通常更高。新手可以用翻译软件辅助。
4. LoRA —— 微调的大招
这是SD最迷人的地方。LoRA 就像是一个特定的“风格插件”或“人物插件”。 比如你有一个特定的二次元角色你想画,或者你特别喜欢某种画风(如吉卜力、油彩、素描)。
怎么用?
- 去C站下载你想要的LoRA文件(.safetensors格式)。
- 把它放到SD的
models/Lora文件夹里。 - 在WebUI的右侧找到“LoRA”选项卡,勾选你下载的模型。
- 在提示词里会出现类似
[lora:名字:权重]的代码。- 例如:
[lora:chinese_dress:0.8] - 权重是关键,0.8表示80%的影响,1.0是原生影响。如果效果太猛,就调低;如果没效果,就调高。
- 例如:
5. 控制网 (ControlNet) —— 姿势和构图的上帝
这是SD碾压MJ的核心优势。 你想让AI画的人,摆出你随手画的火柴人姿势?或者保持你照片里的构图?
步骤:
- 在右侧面板找到 ControlNet 扩展。
- 上传一张参考图(比如你的素描草图,或者一张实拍照片)。
- 选择预处理模型(Preprocessor)。
canny:提取边缘线条(适合线稿控制)。openpose:提取骨骼姿态(适合控制人物动作)。depth:提取深度信息(适合控制空间关系)。
- 生成图片,你会惊讶地发现,AI完美复刻了你草图的构图,只是渲染出了精美的画面。
第四阶段:版权避坑 —— 别等被起诉了才来看
这部分,请拿出小本本记下来。这是很多创作者容易忽视的“地雷区”。
1. Midjourney 的版权归属
这是一个灰色地带,且随着时间变化。
- 目前现状: 美国版权局(USCO)初步裁定,纯AI生成的作品,不包含人类足够的创造性贡献,无法获得版权保护。
- 这意味着什么? 你画了一张图,发到网上,别人可以随便拿去用,你不能告他侵权。反之,你也不能声称这张图“著作权归你”。
- 但是! 如果你在MJ的基础上进行了大量的后期修改、拼接、PS处理,那么修改后的整体作品可能享有版权。
- 服务条款: MJ的用户协议规定,用户拥有生成的图片的“使用权”,但MJ保留图片用于训练和改进模型的权力。简单说:图是你的,但AI厂商也能用。
2. Stable Diffusion 的版权归属
SD本地部署,情况更复杂:
- 模型本身: 大多数开源模型(如ChilloutMix)是基于Common Crawl等海量网络数据训练的,这些数据中包含了无数艺术家、摄影师的作品。这引发了巨大的法律争议。
- 你的输出: 同样,在美国,纯SD生成的图片很难申请版权。但是,国内的情况略有不同。中国杭州互联网法院曾判例认定:在AI生成过程中,用户投入了智力劳动(如反复调整提示词、参数、选择模型、后期处理),该生成物可以被视为作品,享有著作权。
- 关键差异: 国内更看重“人机协作”中的“人的贡献”。如果你只是输出一句话就出图,风险较大;如果你用了ControlNet、多次迭代、后期精修,你拥有版权的可能性大大增加。
3. 实用避坑指南
- 商用前查清楚: 如果要用AI图做商业广告、包装设计,务必咨询律师。不同国家法律差异巨大。
- 避免生成受保护形象: 不要生成明显的“米老鼠”、“孙悟空”、“迪士尼角色”等受版权保护的IP形象。这不仅是版权侵权,还可能违反平台规则。
- 不要上传敏感内容: 避免生成色情、暴力、政治敏感内容。这不仅违法,而且很多平台会封号。
- 保留创作过程: 保存你的提示词、参数设置、控制网草稿、PSD源文件。这些是证明你“智力投入”的关键证据。
- 区分“学习”和“侵权”: 使用别人的风格(Style)是允许的,但直接复制别人的具体作品(Copy)是侵权行为。AI擅长模仿风格,你要警惕不要滑向直接复制。
第五阶段:给零基础新手的“七天通关”计划
别急着买显卡,别急着囤模型。按这个步骤来:
第1天:体验MJ
- 注册Discord和MJ账号(可能需要翻墙和美元支付方式)。
- 输入最简单的提示词,如
a cat astronaut on the moon。 - 感受MJ的“傻瓜式”美好,理解什么是“随机性”。
- 尝试使用
--ar和--stylize参数。
第2天:研究提示词逻辑
- 去C站(Civitai)看别人的作品,把鼠标放在图片上,点击“Copy prompt”。
- 分析:他用了什么形容词?什么光影?什么风格?
- 复制这些提示词,在MJ或本地SD里跑一遍,对比效果。
第3天:搭建SD环境
- 如果电脑配置好,下载秋叶整合包。
- 如果电脑配置一般,租用云端服务器(淘宝或阿里云都有,几十块一天)。
- 成功启动WebUI,看到那个复杂的界面,不要慌,它就像你第一次打开Photoshop。
第4天:学会下载和使用模型
- 在C站下载一个稳定的大模型(如ChilloutMix)。
- 学会把它放进
models/Stable-diffusion文件夹。 - 在WebUI左上角切换模型,第一次看到生成图的那一刻,你会震撼。
第5天:掌握负面提示词
- 复制上面的负面提示词模板。
- 尝试生成一张人像,对比开启和关闭负面提示词的效果。你会立刻明白它的重要性。
第6天:挑战ControlNet
- 找一张自己的随手涂鸦,或者一张网图。
- 使用
openpose或canny控制网,让AI按照你的构图生成图像。 - 这是你从“抽卡玩家”变成“设计师”的分水岭。
第7天:整合与输出
- 尝试完成一个完整项目:比如“设计一张科幻电影海报”。
- 流程:MJ构思灵感 -> SD细化生成 -> PS后期调色 -> 合成。
- 思考:这张图,我拥有多少版权?
结语:工具只是工具,创意才是核心
写到最后,我想告诉你一个真相:AI不会取代设计师,但会用AI的设计师会取代不会用的。
Midjourney和Stable Diffusion只是你的画笔。如果你不懂光影、不懂构图、不懂色彩理论,AI生成的图片可能会显得“油腻”或“空洞”。相反,如果你有一个清晰的创意内核,AI能帮你把实现的时间从一周缩短到一小时。
所以,别沉迷于参数,多去欣赏优秀的艺术作品,多去观察现实生活中的光影。当你的审美在线时,AI才能成为你最强大的助手。
现在,去打开你的Discord,或者启动你的SD,写下你的第一个提示词吧。哪怕只是 a cute cat,那也是你创作之旅的第一步。
祝你在AI艺术的海洋里,玩得开心,画得尽兴,且合法合规。
