说实话,两年前如果有人告诉我,只需敲几行字就能生成一张媲美摄影师或插画师几周心血的作品,我大概会觉得他在吹牛。但现在,看着屏幕上那些纹理细腻、光影真实得令人毛骨悚然的图像,我不得不承认:我们正站在艺术创作方式变革的门槛上。
这篇指南不打算给你灌那些“未来已来”的陈词滥调。我想做的是把你从“这是什么?”的困惑,一路带到“我能靠这个做什么”的实战阶段。我们会聊Midjourney的优雅与易用,也会聊Stable Diffusion的硬核与自由,更会直面那些让艺术家们夜不能寐的版权和艺术价值争议。准备好了吗?让我们开始。
第一部分:认识你的新画笔——Midjourney vs. Stable Diffusion
在动手之前,你得知道手里拿的是什么样的工具。这就像摄影师选择相机一样,不同工具适合不同场景。
Midjourney:优雅的“黑盒”艺术家
Midjourney是目前最容易上手、出图质量最高的AI绘画工具之一。它运行在Discord平台上,这意味着你不需要配置复杂的本地环境,只需要一个Discord账号和每月10美元起的订阅费。
为什么我推荐它给新手?
想象一下,你想画一只“穿着维多利亚时代礼服、坐在月球上的柴犬,赛博朋克风格,霓虹灯光”。在Midjourney里,你只需输入:
/imagine prompt: A Shiba Inu wearing a Victorian-era dress, sitting on the moon, cyberpunk style, neon lighting, photorealistic, 8k --ar 16:9 --v 6.0
回车,等待45秒到2分钟,你就会得到四张令人惊叹的图像。Midjourney的优势在于审美在线。它默认的参数配置就能产生具有艺术感的作品,不需要你懂太多的技术细节。
Midjourney的核心参数速查:
--ar 16:9:设置图片宽高比(比如16:9适合做桌面壁纸)--v 6.0:指定使用第6版模型(目前最稳定、质量最高)--style raw:减少AI的过度美化,更接近真实摄影感--s 100:风格化程度,0是不风格化,1000是高度风格化
Stable Diffusion:掌控一切的“数字炼金术士”
如果Midjourney是精装修的公寓,Stable Diffusion(简称SD)就是一套你拥有完全产权的自建房。它是开源的,可以在你自己的电脑上运行(需要一块不错的显卡,至少8GB显存,推荐NVIDIA RTX 3060以上),也可以租用云端服务器。
为什么选择Stable Diffusion?
- 完全免费:一旦环境搭建好,每张图的生成成本接近于零。
- 无审查:你可以生成任何内容,不受商业平台的内容限制。
- 深度控制:通过ControlNet等插件,你可以精确控制构图、姿势、边缘检测,甚至让AI画出你指定的草图。
- 模型生态丰富: Civitai等平台上每天有数百个新的Checkpoint模型、LoRA模型发布,你可以下载专门画动漫、写实摄影、油画的专属模型。
Stable Diffusion的“三大件”模型解释:
- Checkpoint(大模型):相当于AI的“基础审美”。比如Realistic Vision适合写实摄影,DreamShaper适合奇幻风格。
- VAE:负责图像的解码和色彩还原,好的VAE能让图片颜色更鲜艳、细节更清晰。
- LoRA:轻量级微调模型,可以用来固定某个特定角色、风格或物体。比如你想让AI专门画“吉卜力风格的龙猫”,一个LoRA就够了。
第二部分:从零到一的实战——Midjourney创作流程
让我们以“创作一张用于游戏宣传的奇幻场景图”为例,走完整个Midjourney流程。
第一步:构思你的提示词(Prompt)
提示词是AI绘画的灵魂。一个优秀的提示词结构通常包括: 主体 + 环境/背景 + 艺术风格 + 光线/氛围 + 技术参数
例如,我们要画“一个古老的森林神庙”:
基础提示词:
Ancient forest temple, overgrown with vines, mystical atmosphere添加细节:
stone pillars covered in moss, glowing blue mushrooms, soft sunlight filtering through the canopy, ethereal, mysterious指定风格:
concept art, fantasy illustration, by Greg Rutkowski and Alphonse Mucha技术参数:
--ar 16:9 --v 6.0 --style raw
组合起来:
/A imagine Ancient forest temple, overgrown with vines, stone pillars covered in moss, glowing blue mushrooms, soft sunlight filtering through the canopy, ethereal, mysterious concept art, fantasy illustration, by Greg Rutkowski and Alphonse Mucha --ar 16:9 --v 6.0 --style raw
第二步:生成与迭代
发送命令后,你会收到4张图。此时你有几个选择:
- U1-U4:选择其中一张进行高清放大(Upscale)。U1会生成一张4倍分辨率的图,细节更丰富。
- V1-V4:选择其中一张生成4个变体。这能帮你在原有基础上探索不同构图或细节。
- 重绘(Inpainting/Var):如果想修改图中某个部分(比如把石头换成木头),可以使用Midjourney的局部重绘功能。
第三步:后期优化
Midjourney生成的图片通常是1024x1024或1920x1080分辨率,对于印刷或高清展示可能不够。这时候你需要:
- 使用Upscale工具:Midjourney自带的U功能已经足够好,但如果需要4K以上,可以使用Topaz Gigapixel AI或Online Upscalers。
- 修复手指和细节:AI画手仍然会出错。可以用Photoshop的“生成式填充”功能,选中出错区域,输入“correct hands”进行修复。
第三部分:深入Stable Diffusion——WebUI安装与基础使用
Stable Diffusion的学习曲线较陡,但一旦掌握,你的创作自由度将呈指数级增长。
第一步:安装ComfyUI或Automatic1111
对于新手,我推荐Automatic1111(简称A1111),它的界面最友好,教程最多。
安装步骤(Windows系统):
- 确保你的电脑有NVIDIA显卡,并安装了CUDA驱动。
- 下载Git和Python 3.10。
- 克隆仓库:
git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git - 运行
webui-user.bat,脚本会自动下载依赖。 - 打开浏览器访问
http://127.0.0.1:7860。
第二步:下载Checkpoint模型
去Civitai.com下载你喜欢的模型。比如“Realistic Vision V5.1”适合写实摄影。下载后放入stable-diffusion-webui/models/Stable-diffusion文件夹,刷新页面即可选择。
第三步:理解核心参数
在A1111界面,你会看到一堆滑块和输入框。以下是关键参数:
- Prompt(正面提示词):你想画什么。
- Negative Prompt(负面提示词):你不想画什么。例如:
bad anatomy, blurry, low quality, watermark, text。 - Sampling Method(采样方法):推荐
Euler a或DPM++ 2M Karras。前者快,后者质量高。 - Sampling Steps(采样步数):一般20-30步足够。步数越多,细节越丰富,但时间也越长。
- CFG Scale(引导系数):控制提示词对图片的影响强度。默认7,越高越严格遵循提示词,过低会偏离主题,过高可能导致图像过饱和或崩坏。
- Resolution(分辨率):SD原生支持512x512或768x768。如果生成1024以上的图片,建议使用Hires. fix(高清修复)功能,它会在生成后自动放大并细化细节。
第四步:ControlNet——精确控制的秘密武器
ControlNet是SD的杀手锏插件。你可以上传一张草图、姿态图或边缘检测图,让AI严格按照你的构图生成。
例子:你想画一个特定姿势的角色。
- 找一张模特照片,用OpenPose提取骨架。
- 在ControlNet中上传这张骨架图,选择“OpenPose”预处理器。
- 在提示词中输入“a woman standing confidently, fashion photography”。
- 生成!AI会严格遵循骨架姿势,同时根据你的描述生成细节。
这解决了AI绘画最大的痛点:不可控性。
第四部分:高清图片创作的技巧与陷阱
无论是Midjourney还是Stable Diffusion,生成“高清”图片不仅仅是放大分辨率,而是增加细节的合理性和真实感。
技巧1:善用细节描述词
模糊的图片往往是因为提示词过于笼统。尝试添加以下词汇:
- 光影:
volumetric lighting, ray tracing, subsurface scattering(次表面散射,适合皮肤和蜡) - 材质:
subtle skin pores, fabric texture, reflections, 8k resolution - 镜头:
shot on Sony A7R IV, 85mm lens, f/1.8, bokeh
技巧2:局部重绘(Inpainting)
当整体图片很好,但某个细节(如眼睛、手指)出错时,不要重新生成整张图。使用“inpaint”功能,涂抹出错区域,输入修正提示词(如“perfect eyes, detailed iris”),AI只会重绘该区域。
技巧3:Stable Diffusion的超分技巧
在A1111中,启用“Hires. fix”,设置放大倍数为2,选择“Latent”或“ESRGAN”作为上采样器,并设置“Denoising strength”为0.3-0.5。这会在放大过程中添加合理的细节,而不是简单地插值模糊化。
常见陷阱
- 过度饱和:降低CFG Scale或添加“natural colors”提示词。
- 重复纹理:这是AI的通病,尤其是画布料和毛发时。尝试添加“varied patterns”或使用SD的“patchmatch”功能。
- 手指畸形:在提示词中加入“perfect hands, detailed fingers”,或在后期用PS修复。
第五部分:版权争议——谁拥有AI生成的图像?
这是目前AI绘画领域最混乱、也最至关重要的部分。很多新用户甚至从业者对此一无所知,一旦用于商业用途,就可能面临法律风险。
现状:版权保护的灰色地带
美国版权局(USCO)的立场: 截至目前,美国版权局明确表示,完全由AI生成的图像无法获得版权保护。2023年,一幅AI生成的作品《Théâtre D’opéra Spatial》在科罗拉多州艺术博览会获奖后,创作者被要求标注AI使用情况,且该作品未获版权登记。版权局认为,版权法保护的是“人类作者”的智力创作,而AI是工具,不是作者。
关键点:
- 如果你只是输入提示词,生成后不做任何人工修改,你很可能不拥有版权。
- 如果你在AI生成的基础上进行了大量人工修改(如在Photoshop中重新绘制、调整、合成),那么修改部分可能受版权保护,但整体作品的版权归属仍存在争议。
Midjourney的版权条款
Midjourney在2023年修改了其服务条款:
- 付费用户:拥有生成图像的商业使用权,但不拥有版权。Midjourney声称放弃版权,以便用户自由使用。
- 免费用户:仅拥有非商业使用权,且图像受限于内容政策。
这意味着什么? 你可以在广告、商品上使用MJ生成的图像,但你不能阻止别人也使用相同或类似的图像。如果某家公司用MJ生成了一张独特的logo,另一家公司也可以使用,因为没有版权保护。
Stable Diffusion的版权风险
SD是开源软件,模型本身由社区训练。问题在于训练数据。
- 大多数SD模型(包括Realistic Vision、DreamShaper等)是在LAION-5B等数据集上训练的,这些数据集包含数亿张来自互联网的图片,其中很多可能受版权保护。
- 如果AI生成的图像与训练数据中的某张受版权保护的图片过于相似,版权持有人可能发起诉讼。目前,已有艺术家对Stability AI(SD的开发商)提起集体诉讼。
如何规避版权风险?
- 不要声称AI图像为“原创”:在发布作品时,明确标注“AI辅助生成”或“AI生成”,避免误导。
- 进行实质性人工修改:在Photoshop中重新构图、绘制细节、添加自己的艺术元素。这样,你的创作贡献可以被认定为版权保护的依据。
- 使用商用授权模型:有些模型(如某些付费LoRA)的作者明确授予商用版权,使用前仔细阅读许可证。
- 避免生成知名IP:不要生成米老鼠、漫威角色等受版权保护的图像,即使是用AI生成,也可能构成侵权。
第六部分:艺术价值争议——AI是工具还是创作者?
这部分没有标准答案,但它决定了你如何看待自己的创作。
论点一:AI绘画不是艺术,是“概率计算”
批评者认为,AI只是通过海量数据学习统计规律,然后生成“最可能”的图像。它没有情感、意图或审美判断。因此,AI生成的图像缺乏“艺术灵魂”。
反驳: 摄影师在拍摄时,也依赖相机(技术工具)和光线(物理规律)。艺术家使用画笔、颜料,这些也是工具。AI只是更复杂的工具。关键问题是:谁在控制创作过程?
如果你只是随机输入提示词,然后对结果满意与否,那确实更像“随机生成”。但如果你像我一样,精心构思提示词,迭代数十次,使用ControlNet精确控制构图,再进行后期调色和细节绘制,那么你的意图和审美判断贯穿了整个创作过程。AI只是执行者,你是导演。
论点二:AI绘画贬低了人类艺术家的价值
许多插画家、概念设计师担心,AI能快速生成他们需数天完成的作品,导致市场价值下降。这是现实的压力。
我的看法: 技术革命总会淘汰部分岗位,但也创造新机会。AI不会取代所有艺术家,但会取代不使用AI的艺术家。未来的艺术家需要具备“AI策展人”的能力——能精准引导AI,能判断和优化输出,能将AI素材融入更大的艺术概念中。
如何提升AI绘画的艺术价值?
- 建立个人风格:不要只做“好看但平庸”的图。通过LoRA训练自己的风格,或在提示词中融入独特的艺术史参考(如“in the style of Hokusai and Van Gogh”),形成辨识度。
- 叙事性创作:艺术不仅是视觉,更是故事。用AI生成一系列图像,讲述一个连贯的故事,这比单张图更有艺术价值。
- 混合媒介:将AI图像与手绘、拼贴、数字 painting 结合。让AI成为素材库,而非最终成品。
结语:拥抱工具,保持人性
AI绘画技术正在以惊人的速度发展。从2022年的DALL-E 2到现在的Midjourney V6和SDXL,每一次迭代都让图像更真实、更可控。但请记住,工具本身没有价值,使用工具的人才有。
无论你是想用AI快速生成游戏素材,还是想探索新的艺术表达形式,我都鼓励你动手尝试。从Midjourney的简洁开始,感受创意落地的喜悦;然后深入Stable Diffusion的复杂世界,掌握精确控制的艺术。同时,保持对版权和法律边界的敏感度,这是对创作者的基本尊重。
最后,我想分享一个观点:艺术的价值不在于创作工具是画笔、相机还是算法,而在于它能否触动人心,能否表达创作者的独特视角。AI不会取代这一点。它只是让我们更容易实现那个愿景。
现在,打开你的Discord或启动你的WebUI,输入第一个提示词吧。你的AI创作之旅,从现在开始。
