AI绘图想进阶?深度学习基础帮你少走弯路
简单说:AI绘图进阶卡住,多半是不懂参数背后的深度学习原理。我只补了三块基础——扩散去噪、潜空间、CFG——就把废图率从九成压到四成。别啃公式,学到能解释自己的每个参数就够了。
ai绘图深度学习这个词,我以前看到就划走,总觉得那是程序员的事,跟我一个画图的没关系。去年十月的一张商单海报把这种侥幸砸碎了。那晚我熬到凌晨两点,翻了三百多张图,能用的两张。挺离谱的。
我做品牌设计七年,用Stable Diffusion两年多,前一年半基本在瞎调,参数照搬大佬分享,出图全凭抽卡运气。后来我花了大概六周,每天四十分钟,断断续续补了一点深度学习的底层逻辑。出图的变化,比换任何新模型都明显。
这篇就讲这个变化。
学原理之前,我调图基本靠玄学
老实讲,我前一年半的调图方式就是抄参数加抽卡,废图率长期在九成上下,而且根本不知道该怎么改进。不是工具不行,是我完全看不懂工具在干什么。
2023年我接了个奶茶品牌的水彩插画单。提示词堆到八十多个词,采样器用教程里抄来的Euler a,步数永远30,CFG跟着感觉在4到13之间乱跳。从晚上八点搞到凌晨一点,生成三百一十张,能交的两张,客户还返了两次工。
更丢人的是出图崩了之后我的处理方式——点一下重新生成,然后祈祷。印象最深的是有回我把CFG拉到15,想着数值越高模型越听话,结果颜色像中了毒,手部全崩,我还傻乎乎地回去改提示词,白改四十分钟。
方向全错了。
转折发生在一个设计群。我吐槽AI绘图不听话,一个做算法的群友回了句:"你至少要知道CFG在惩罚什么。"这句话把我噎住了。我连生图是从噪声里一步步还原出画面这件事都不知道,谈什么调参。
回家路上我下了个白话讲扩散模型的视频合集,看完第一节愣了半天。原来我每天调的那些东西,每一个都有明确含义:步数对应去噪的精细程度,采样器是从噪声走到图像的路线,CFG是提示词拽着模型走的力度。窗户纸捅破之后就顺了,我又把潜空间和文本编码也补了。没碰一行公式。
ai绘图深度学习该补哪几块?只学三样就够
围绕ai绘图深度学习,真正值得补的只有三块:扩散去噪的直觉、潜空间的压缩概念、CFG的引导逻辑。数学推导一个都不用碰,能用自己的话把这三样讲明白,调参水平就会上一个台阶。
第一块,扩散模型在干什么。训练时它看几亿张图被逐步加噪,再学会还原;生图时反过来,从一团纯噪声开始,一步步把画面"雕"出来。知道这个,步数和采样器立刻就通了,它们描述的都是"怎么走完这段去噪的路"。
第二块,潜空间。Stable Diffusion不在像素上直接干活,它会把512×768的图压成64×96的张量再处理,也就是8倍下采样。这个事实解释了我一整年的困惑:直接画大图为什么容易崩——模型训练时见过的潜空间尺寸就那么大,硬画768×1152等于让它超纲发挥,双下巴、多出来的手指全是这么来的。
第三块,CFG(classifier-free guidance)。它衡量模型贴合提示词的力度,7左右通常是平衡点,拉太高会过饱和、构图发僵。我那次的15,属于典型的往死里拧。
想看源头的话,Latent Diffusion那篇论文值得翻一翻(arXiv:2112.10752),看不懂字就看配图,结构一目了然。Stable Diffusion这套东西2022年8月由Stability AI和慕尼黑大学的CompVis团队等合作开源,维基百科的Stable Diffusion条目把来龙去脉写得很清楚。概念实在啃不动,可以先读站内的AI深度学习是什么打底,再回来不迟。
搞懂噪声和采样,我把废图率砍了一半
采样器决定去噪走什么路线,步数决定走多细。想通这点后我把流程改成16步先试构图、锁定seed再30步精修,废图率从九成左右降到四成上下。
Euler a是老牌采样器,随机性强,画面偏软,插画感好看,但同一个seed重跑两次都会变;DPM++ 2M Karras收敛快,20到30步基本到头,细节利落。我个人觉得商业出图九成场景,后者都能交差。
我做过一组对照:同seed同提示词,各跑30步。Euler a的成图颜色更"梦幻",DPM++ 2M Karras的结构明显更稳,手指数量都对。给客户的东西,我现在基本锁后者。真想要那层梦幻感,后期调色比换采样器可控多了。
放大逻辑也变了。以前不懂原理,直接768×1152硬画,废图一堆还怪模型烂。现在512×768先把构图定下来,再放大1.5倍,重绘幅度0.35上下,两步走。多花两分钟,稳太多。
潜空间想明白了,提示词才不是抽奖
提示词不是在描述画面,是在潜空间里给模型划范围。划得准,出图就稳,这比堆一长串华丽形容词管用得多。
SD1.5背后的CLIP文本编码器有77个token的硬上限。我以前写九十多个词,还纳闷为什么排在后面的内容经常不出现——根本没被完整编码进去。现在我把提示词压到50个token以内,预算全花在主体、材质、光线这些大权重词上。
权重语法也不是玄学。(word:1.2)的实质是改变这个词在潜空间里的牵引力度。我试了下把rim light从1.0加到1.3,逆光轮廓立刻出来;加到1.5,整个画面开始烧边。有数的感觉,真好。
词序也有讲究。主体放最前,氛围词靠后。
瞎调与懂原理地调:同一类商单的真实对比
同类型需求,我现在的完整流程比过去省一半时间,可用图数量翻了大概六倍。核心差别不在参数本身,在于知道每个参数动了之后会发生什么。
| 环节 | 以前(瞎调) | 现在(懂原理后) | 我的主观评价 |
|---|---|---|---|
| 出图分辨率 | 直接768×1152硬画 | 512×768起手,定稿再放大1.5倍 | 以前崩图崩到麻木 |
| 采样器和步数 | Euler a固定30步 | DPM++ 2M Karras,16步试构图、30步精修 | 稳得不是一个量级 |
| CFG | 4到13之间乱跳 | 风格图5-6,写实7 | 超过9基本没法看 |
| 提示词 | 堆90多个词求全 | 50个token内,主体在前 | 短的反而准 |
| 挑图 | 一晚310张选2张 | 2小时40张选12张 | 心态完全不一样了 |
那张奶茶海报的需求放到现在,我估计两小时内能交初稿。说实话,不是我水平突然变高,是方法换了。这套流程怎么嵌进商业项目,站内的AI深度学习生成图片调参记录写得更细,可以接着看。
ai绘图深度学习学到什么程度算够?我的止损线
ai绘图深度学习学到"能解释自己每个参数为什么这么设"就该停,继续硬啃公式对出图帮助很小。我硬读DDPM论文那次,两周没打开过生图界面。
2025年初我飘过一次。觉得自己懂点原理了,跑去读DDPM原文,看到第三页的马尔可夫链推导直接劝退,之后两周没碰WebUI,有点应激。后来想通了:我是设计师,学这些是为了出图,不是为了转行做算法。
学太深还有个副作用,容易钻进"我要从头训模型"的执念里。真想碰训练,LoRA炼制实用得多。话说回来,那段啃原理的日子有个意外收获——我看懂了LoRA的机制,顺手用自己三十多张旧插画炼了个风格模型。今年有个老客户点名要那个调性,直接多签了一单。
工具和原理的边界怎么划,站内AI技术学习和AI工具使用是两回事讲得比我透。两边精力怎么排,可以参考边学AI画画边学AI那篇的双线法,我就是那么过来的。
常见问题
学AI绘图一定要先懂深度学习吗?
不用,先上手反而更容易坚持。但出图量到几百张之后会撞到一层天花板:教程的参数全抄过了,图还是不稳定。这时候补点原理,是破天花板最快的路。先用起来,卡住了再回头学,顺序别反。
ai绘图深度学习需要会写代码或者数学很好吗?
都不需要。我的数学停在高中水平,代码只会改别人现成的。六周里我看的是白话视频和图解文章,真正用上的算术只有"8倍下采样"这种级别。碰到公式直接跳过,不影响理解主线。
新手该从哪个采样器换起?
我的答案很明确:DPM++ 2M Karras,步数20到30。别再无脑用Euler a了,它随机性强,同seed重跑都会变,新手根本分不清是提示词的问题还是采样器的问题。工具层面还没摸熟的,先看学AI绘画前必看那篇,把基本盘搭好。
写到这里回头看,ai绘图深度学习这个词没想象中吓人,它就是让你从抽卡的人,变成看得懂卡池规则的人。六周的基础,换掉一年半的瞎调,这笔账怎么算都划算。要是你也在凌晨抽卡,先别急着换显卡,花三天补点原理试试。
觉得有用的话,转给那个还在熬夜抽卡的朋友吧,他会感谢你的。