说实话,我第一次看到Midjourney生成的图片时,整个人是懵的。那光影、那质感,我当时真的以为是谁请了顶级插画师连夜赶出来的稿子。直到我亲手打开那个界面,输入几个关键词,看着进度条一点点走完,才意识到——这个玩法,真的把普通人拉进了专业创作的门槛。
今天不跟你扯什么“人工智能赋能美学变革”的大道理,我就想跟你聊聊,作为一个完全不懂代码、不懂绘画的普通人,怎么在周末两天内,从零开始,让Midjourney和Stable Diffusion成为你朋友圈里的“神笔马良”。
一、先理清思路:你到底需要哪种“爆款”?
在动手之前,我得先问你一个问题:你想做什么样的图?
因为Midjourney和Stable Diffusion虽然都能画图,但它们的“性格”完全不同。
Midjourney像个天才画家,你给它一个模糊的想法,它能给你惊艳的结果,但它不给你太多细节控制。比如你说“一只在月球上喝咖啡的猫”,它可能给你一只非常优雅、光影绝美的猫,但如果你想要“这只猫必须戴着一顶红色的贝雷帽,手里拿的是星巴克的杯子”,它就有点挠头了。
而Stable Diffusion像个拥有无限画材的工作室,你能精确控制每一处细节——构图、色调、人物姿态、背景元素——但前提是,你得会“指挥”它。它没有Midjourney那么“智能”,你需要更专业的提示词,甚至需要搭配ControlNet这样的插件来约束画面。
所以,如果你的目标是“快速出图,发朋友圈收获一片点赞”,Midjourney是首选。如果你的目标是“我要做一套统一风格的头像,或者我想把照片变成动漫风”,Stable Diffusion更合适。
咱们先从最容易上手的Midjourney开始。
二、Midjourney:让灵感像呼吸一样自然
1. 如何入门?别慌,先注册账号
很多人听到Midjourney,第一反应是“好贵”、“好麻烦”。其实现在入门比两年前简单太多了。
你需要一个Discord账号(类似国外的QQ群),然后加入Midjourney的官方服务器。这里有个小窍门:如果你不想在官方服务器里看别人的图,可以创建一个“私密服务器”,这样你的生成记录就只有你自己能看到,保护隐私。
注册完成后,你会获得一定额度的免费试用时间(具体额度随官方政策变化,建议去官网确认最新情况)。别心疼那几分钟免费时间,先用来熟悉界面,别一上来就憋大招。
2. 提示词的秘密:怎么说话,AI才听得懂
这是最关键的一环。很多人觉得AI画画是“玄学”,输入什么出什么,其实不是。AI是一个极度依赖语言逻辑的执行者。
让我用一个真实的例子告诉你,为什么你生成的图总是“怪怪的”。
场景:你想生成一张“赛博朋克风格的东京街头夜景,有一个穿着汉服的女孩站在雨中”。
新手提示词:
赛博朋克,东京,雨夜,汉服女孩,好看
结果:画面很乱,汉服和赛博朋克元素打架,女孩的脸可能被扭曲,雨也没下明白。
进阶提示词:
Cyberpunk Tokyo street at night, heavy rain, neon lights reflecting on wet pavement, a young Chinese girl wearing traditional Hanfu dress, holding a transparent umbrella, cinematic lighting, 8k resolution, highly detailed, bokeh background, mood: melancholic but hopeful --ar 16:9 --style raw --v 6.0
结果:你得到的是一张电影海报级别的图像。雨水的质感、霓虹灯的反射、汉服的飘逸、赛博朋克的氛围,全都融合在一起。
看到了吗?差别就在细节和结构。
3. 提示词的黄金结构
我总结了一个公式,你可以直接套用:
[主体描述] + [环境/背景] + [艺术风格/媒介] + [光照/氛围] + [技术参数]
- 主体描述:越具体越好。不是“一个女孩”,而是“一个20岁的东亚女性,长发湿漉漉地贴在脸颊,眼神略带忧郁,穿着淡粉色的汉服,外披一件透明的塑料雨衣”。
- 环境/背景:不仅是地点,还有天气、时间。比如“雨夜的东京新宿街头,积水倒映着广告牌的光芒”。
- 艺术风格:这是决定“味儿”的关键。你可以用“Cyberpunk style”、“Studio Ghibli style”(吉卜力风格)、“Oil painting”(油画)、“Polaroid photo”(拍立得照片)、“Unreal Engine 5 render”(虚幻引擎5渲染)等。
- 光照/氛围:光影是照片和AI图的本质区别。“Cinematic lighting”(电影光)、“Golden hour”(黄金时刻)、“Neon glow”(霓虹光)、“Soft diffused light”(柔和散射光)。
- 技术参数:这是Midjourney的“暗语”。
--ar 16:9:设置宽高比,适合发朋友圈的横图。--style raw:减少Midjourney的“艺术化”修饰,让画面更真实。--v 6.0:指定使用最新的V6版本,画质和细节提升巨大。--s 250:调整风格化程度,数值越低越真实,越高越艺术。
4. 实战演练:做一个“朋友圈爆款”头像
假设你想做一个“中国风武侠少年,手持长剑,背景是竹林,水墨画风格”的头像。
第一步:在Discord里输入 /imagine prompt:
第二步:输入提示词:
A young Chinese martial arts warrior, holding a traditional Jian sword, standing in a dense bamboo forest, ink wash painting style, monochrome with subtle green accents, elegant and powerful posture, misty atmosphere, highly detailed brush strokes, minimalist composition --ar 1:1 --style raw --v 6.0 --s 100
第三步:发送后,你会看到四张初稿。这时候,你可能会发现某一张的人物姿势很好,但背景太乱;另一张光影不错,但剑的细节不对。
第四步:使用“Vary (Region)”功能。这是Midjourney的神器!你可以框选画面中的某个区域(比如只框选人物),然后重新生成这一部分的细节,而不影响其他部分。或者,你可以点击某张图下方的“Upscale (U1-U4)”来放大某一张,获得高分辨率版本。
第五步:如果某张图整体感觉对了,但颜色不喜欢,可以使用“Remix”模式,在保留原图构图的基础上,修改提示词中的风格部分,比如把“ink wash painting”改成“watercolor”。
5. 常见坑与避坑指南
- 人物手部崩坏:这是AI的通病。如果生成的人手有问题,尝试在提示词中加入“perfect hands, detailed fingers, anatomically correct”,或者使用“Vary (Region)”只重绘手部。
- 风格不统一:如果你需要生成一组图片(比如四格漫画),建议在提示词中加入固定的风格描述,并使用“–cref”功能,上传一张参考图,让AI保持风格一致性。
- 文字乱码:Midjourney V6之后对文字的支持好了很多,但还是不建议让它生成复杂的中文字符。如果需要文字,建议后期用PS或其他工具添加。
三、Stable Diffusion:把创作控制权牢牢抓在手里
如果说Midjourney是“请神”,那Stable Diffusion就是“自己开宗立派”。它免费、开源、可本地部署,但学习曲线陡峭。
1. 为什么选择Stable Diffusion?
- 完全免费:只要你有显卡,就能无限次生成。
- 隐私安全:所有图片都在你本地生成,不会上传到任何云端。
- 高度可控:通过ControlNet等插件,你可以精确控制人物的姿势、边缘、深度图等。
- 模型生态丰富:你可以从Civitai等网站下载各种风格的大模型,从写实照片到动漫美少女,应有尽有。
2. 环境搭建:别被劝退,其实没那么难
很多人听到“本地部署”、“Python”、“Git”就头疼。但现在的解决方案已经非常友好。
我推荐使用 Stable Diffusion WebUI (Automatic1111) 或 ComfyUI。对于新手,Automatic1111更直观,像网页一样操作;ComfyUI更强大,但需要连线逻辑。
最简单的入门方式:
- 下载“秋叶整合包”(国内非常流行的打包版本,集成了Everything,一键启动)。
- 解压到D盘(建议用英文路径)。
- 运行启动脚本,等待自动下载依赖(这需要一些时间,建议开VPN)。
- 启动后,浏览器会自动打开一个本地网页,你就可以开始使用了。
硬件要求:
- 显卡:NVIDIA显卡,显存建议8GB以上(12GB更佳)。
- 内存:16GB以上。
- 硬盘:预留50GB以上空间。
3. 提示词体系:和Midjourney有什么不同?
Stable Diffusion的提示词逻辑类似,但更强调“权重”和“负面提示”。
正面提示词:
- 使用括号调整权重:
(masterpiece:1.2)表示增加权重,[bad:0.8]表示降低权重。 - 常用质量标签:
best quality, masterpiece, ultra-detailed, 8k, photorealistic。
负面提示词:
- 这是SD的杀手锏!你可以在负面提示词中告诉AI“不要什么”。
- 常用负面词:
lowres, bad anatomy, bad hands, text, error, missing fingers, extra digit, fewer digits, cropped, worst quality, low quality。 - 还有一个神器叫 BadDream 或 EasyNegative,这些是预训练好的负面嵌入模型,只需要在负面提示词中写上它们的名称,就能大幅提升画面质量。
4. ControlNet:让AI听话的核心武器
ControlNet是Stable Diffusion区别于其他工具的真正核心竞争力。它可以让你用一张线稿、一张深度图、一张人物姿势图,来精确控制生成结果。
场景:你有一张自己在旅游时拍的照片,想把自己变成“宫崎骏动画风格”。
步骤:
- 在SD的ControlNet单元中,上传你的照片。
- 选择预处理模型:
canny(边缘检测)或depth(深度图)。 - 设置权重:
0.8左右。 - 输入提示词:
Miyazaki Hayao style, anime, colorful, beautiful scenery, girl standing on a hill。 - 生成。
你会发现,AI不仅把照片变成了动漫风格,还完美保留了你原本的构图和人物姿态。这就是ControlNet的威力。
5. 实用插件推荐
- ADetailer:自动修复人脸和手部。生成后,这个插件会自动检测人脸,用另一个模型重新绘制,解决脸部崩坏问题。
- Regional Prompter:允许你在画面的不同区域使用不同的提示词。比如,你想生成“左边是森林,右边是城市”,这个插件就能做到。
- IP-Adapter:类似于Midjourney的“风格参考”,但更强大。你可以上传一张参考图,让生成图在风格、内容、甚至面部特征上与之保持一致。
6. 实战:制作一组“四格漫画”头像
假设你想做一套四格漫画,讲述一个小故事。
第一步:确定故事线。比如:早上起床 -> 上班路上 -> 工作中 -> 下班回家。
第二步:使用LoRA模型。LoRA是一种小型训练模型,可以固定画风。比如你喜欢的某个画师的风格,可以在Civitai上找到对应的LoRA模型,加载后生成,画风就会高度统一。
第三步:使用ControlNet的OpenPose。你可以找一张参考姿势图,或者用手势生成姿势图,确保四格中的人物动作连贯。
第四步:批量生成。使用SD的“批量生成”功能,一次生成多张,然后从中挑选最佳组合。
四、进阶技巧:如何让图片更“像人”而不是“像AI”
现在朋友圈里AI图泛滥,如何脱颖而出?秘诀在于“不完美的完美”。
1. 引入“随机性”
完全精确的AI图往往显得死板。你可以故意在提示词中加入一些“意外”元素,比如“slightly out of focus”(轻微失焦)、“motion blur”(动态模糊)、“film grain”(胶片颗粒感)。这些瑕疵会让图片更有“人味儿”。
2. 后期微调
不要以为生成完就结束了。用Photoshop或甚至免费的Photopea,对图片进行微调:
- 调整色彩饱和度,让画面更通透。
- 添加噪点,模拟真实相机质感。
- 手动修正AI生成的错误细节(比如多出来的手指)。
- 添加文字或贴纸,增强叙事性。
3. 创建个人风格库
长期积累你的成功提示词。建立一个文档或Notion页面,记录下每次生成爆款图所用的提示词、参数、以及最终效果。你会发现,有些组合是“万金油”,有些则只适合特定场景。
五、伦理与版权:别踩红线
作为创作者,我们必须清醒。
- 版权意识:Midjourney生成的图片,目前在美国版权法下,创作者拥有版权,但商用仍需注意其服务条款。Stable Diffusion生成的图片,版权归属较模糊,商用前务必咨询法律意见。
- 尊重原创:不要使用他人的作品作为参考图去“克隆”风格,尤其是在未经同意的情况下。
- 真实性声明:在发布AI生成图片时,建议标注“AI生成”,这是对观众的尊重,也是避免争议的聪明做法。
六、结语:工具是死的,人是活的
回到开头的问题:什么是“爆款”?
爆款不是参数堆砌的结果,而是你想法的视觉化。Midjourney和Stable Diffusion只是笔和纸,真正决定作品高度的,是你眼中的世界、你讲的故事、你传达的情感。
我见过很多用Midjourney生成精美风景图的人,点赞寥寥。也见过有人用Stable Diffusion生成一张略显粗糙但充满个人趣味的头像,收获数百点赞。为什么?因为后者有“人”的温度。
所以,别沉迷于研究最新的模型参数。先去观察生活,去构思一个有趣的故事,然后用这些工具,把你的故事画出来。
当你第一次看到AI完全按照你的想象,呈现出一张从未存在过的画面时,那种惊喜和创造欲,是任何算法都无法替代的。
现在,去打开Discord,或者启动你的WebUI,输入你的第一个提示词吧。记住,第一张图永远不会完美,但第二张、第三张……会越来越像你想要的那样。
祝你玩得开心,期待在朋友圈看到你的作品。
