简单说,AI 生图不是真的“理解人脸”,它更像一个看过海量图片的“超级拼图选手”。它根据提示和训练数据,一步步猜每个像素该是什么颜色。脸崩,通常是因为下面几件事凑在一起。
第一,脸太精细。眼睛、鼻子、嘴、眉毛、耳朵之间的比例差一点,人就会觉得怪。可 AI 不懂骨骼和肌肉,只会学“大概这样像脸”。所以它容易把不同角度、不同人的五官拼在一起,出现歪眼、融嘴、多鼻孔。
第二,脸在画面里常常太小。AI 生成时先在低分辨率“草稿空间”里工作,再放大解码。脸如果只占几十个像素,五官信息很少,放大时只能靠猜,细节就崩了。多人图更明显,因为每张脸分到的像素更少。
第三,AI 没有三维模型。它不知道头是个球,眼睛长在眼窝里。它只见过平面照片。遇到侧脸、低头、遮挡、手挡脸、极端光照时,它不知道被挡住的部分应该怎样,就容易生成错位结构。
第四,训练数据很杂。网上的人脸有正脸、侧脸、模糊、化妆、滤镜、卡通、多人合照。模型学到的是一堆平均和混合规律。当提示词不具体,或者不同特征冲突时,它就会自由发挥,把“美女”“微笑”“侧光”“动漫”等概念混在一起,脸就崩了。
第五,生成过程会累积错误。扩散模型从噪声开始,一步步去噪。前面几步如果把眼睛位置猜歪了,后面会沿着错误继续画,越画越像真的,但结构还是歪的。CFG 太高、步数不合适、模型太旧、LoRA 冲突,也会加重这种问题。
所以,脸崩不是 AI 故意捣乱,而是它在用“猜像素”的方式画最需要精确结构的东西。想改善,可以让脸在画面里大一点,提高分辨率,用专门的人脸模型或修脸插件,做局部重绘,降低过高的 CFG,提示词写清楚,多抽几张再挑。这样脸崩的概率会小很多。 |
|