DDCherry

方法论13 分钟阅读

为什么直接说「漂亮模特」效果差

AI 人像出图塑料感的根源不是模型不行,而是提示词漏掉了四个层次——人物、服装、光线、镜头。一个可复用的四层框架,附三组前后对比。

四张并排的 AI 人像:同一位模特、同一件米色针织衫,提示词从「漂亮模特」逐步补齐到人物、服装、光线、镜头四个层次

做电商的大概都试过这件事:手上有一件毛衣、一条裙子、一副耳环,想要一张模特上身图。于是打开 AI,写下最自然的那句话:

几乎所有人的第一条提示词

漂亮模特穿着米色针织毛衣,高清,写实,8k

出来的图,说它是「一个人穿毛衣的照片」没错,但完全不能用。皮肤是那种打了十层磨皮的蜡感,光不知道从哪儿来的,毛衣像是画上去的而不是穿上去的。跟真实的商品图摆在一起,任何人半秒钟就能分出哪张是 AI。

这时候第一反应通常是怪工具:是不是该换 Midjourney、是不是得等下一代模型。偶尔确实如此,但绝大多数情况下,问题在于上面那句话里几乎没有任何有效信息,模型只能把每一个空缺都用「平均值」填上。

「漂亮模特」到底在要什么

要理解这一点,得先想清楚图像模型拿到一个模糊形容词时会做什么。

这类模型是从海量的「图片 + 描述」里学出来的。你写的每个词,都对应它学到的某一片区域——一堆被这样描述过的图片。当你写得精确,比如「85mm 镜头,f/2,略低于视线高度拍摄」,你指向的是一片很窄、内部高度一致的区域:里面几乎每张图都共享真实的视觉特征——背景被压缩、焦外柔和过渡、面部几何关系稳定。

而当你写「漂亮」,你指向的是一片极其庞大的区域。修过图的杂志封面、小红书自拍、图库素材、游戏渲染图、婚纱照、美颜相机的输出……它们之间几乎没有任何共同点,唯一的共同点是曾经有人用「漂亮」形容过。

于是模型只能做那件唯一合理的事:返回这片区域的中心位置。也就是——所有被形容为「漂亮」的图片的平均值。

这个认识会改变整件事的思路:你要做的不是「让它出得更好」,而是「让它出得更窄」。每一个真正起约束作用的词,都是在把结果从那团平均值里往外拽。

顺带也解释了为什么堆质量词没用。高清大师作品8k获奖摄影 这类词感觉上应该有用,但它们不指向任何具体的视觉属性——好图旁边有它们,烂图旁边也有它们。它们最多是四舍五入的噪声,而且还挤占了你本该用来写具体信息的位置。

四个层次

反复迭代之后你会发现,真正稳定有效的提示词,描述的永远是同样四件事。倒不是「四」这个数字有什么魔力,而是这恰好是一个真实摄影师按下快门前必须做的四个决定,并且每一个都会在成片上留下可见的痕迹。

层次 它决定什么 不写会怎样
人物 谁在画面里,年龄、体态、表情、姿态 一张平均脸,表情空洞
服装 材质、版型、松紧、颜色、垂坠感 布料像贴图,不像穿在身上
光线 方向、软硬、光源、色温 均匀的环境光,没有阴影方向
镜头 焦段、光圈、距离、机位高度 广角畸变,空间关系是平的

顺序不重要,覆盖到才重要。关键在于:漏掉一层,模型不会把它留白,而是拿平均值填上。漏写不是「不做选择」,是把选择权交出去了

第一层 · 人物

目标不是描述某个具体的人,而是给足约束,让模型停止把一堆脸平均在一起。

人物层

二十七八岁的女性,深棕色齐肩发,一缕别在耳后,表情放松、[平静 / 微微含笑], 视线略微偏离镜头看向左侧,站姿重心落在后脚,一只手随意插在口袋里

替换 [方括号] 部分。表情和视线方向最关键,比任何长相描述都管用。

这里真正起作用的是两件事。

表情和视线。「视线略微偏离镜头」是人像提示词里性价比最高的一句话。训练数据里有巨量的正面自拍和图库素材,直视镜头会把你直接拽回那片平均区域;而移开视线会把结果推向时尚大片的方向——商业图片实际上大多是那个调性。

姿态的具体性。「重心落在后脚」「一只手插口袋」远比「自然地站着」有用。「自然」又是一个平均词,而重心分布是模型能实际渲染出来的物理事实。

不该写的:堆砌五官描述。「高颧骨、丰唇、杏眼、下颌线清晰」这一串会把结果推向美颜滤镜那片区域——塑料感恰恰就是从那儿来的。

第二层 · 服装

如果你卖的就是这件衣服,这一层直接决定图能不能用于商业用途。一张「看起来很像那么回事的毛衣」的照片,卖不了你那件毛衣。

服装层

宽松版米色罗纹针织毛衣,粗针美利奴羊毛,落肩设计,罗纹袖口, 衣长到胯下一点,面料厚度足以撑起版型,下装搭配直筒深色牛仔裤

材质和克重这两个词,对质感的影响比任何颜色描述都大。

三个要点。

写材质,不只写外观。「粗针美利奴羊毛」和「棉质平纹针织」渲染出来完全不同,跟「羊绒混纺」又是另一回事。这些是模型确实学到过的物理差异,材质是控制质感最强的一根杠杆。

描述它怎么挂在身上。「落肩」「衣长到胯下一点」「厚度足以撑起版型」——垂坠感是「一张衣服的照片」和「一张衣服的渲染图」之间的分界线。

颜色要加限定词。「米色」是一大片范围,「暖燕麦米色」或「偏冷的灰米色」能收窄很多。如果你要对上实物商品的颜色,具体性配额就该花在这儿。

第三层 · 光线

如果你只肯往现有提示词里加一层,加这一层。光线是把「AI 图」变成「照片」最稳定有效的一层,也是几乎所有人都会漏掉的一层。

光线层

柔和的定向自然光从画面左侧的大窗户射入,光线在背景上柔和衰减, 下颌下方有淡淡的投影,午后偏暖的色温,皮肤上没有过曝的高光

方向 + 软硬 + 光源,三个要素缺一不可。

每一段光线描述都需要三个要素:

  • 方向——「从画面左侧」「从后上方」「正面略微偏轴」。方向决定阴影,而阴影是画面产生立体感的唯一来源。
  • 软硬——「柔和」「硬朗」「漫射」「直射」。柔光来自靠近主体的大面积光源,硬光来自小的或远的光源,这决定了阴影边缘过渡的急缓。
  • 光源——「大窗户」「阴天天光」「单只柔光箱」「黄昏斜阳」。这一个词就把色温和衰减特性打包说清楚了,而且模型对这类词理解得相当好。
加入光线层之后:柔和的定向窗光从左侧射入,背景有明显的光线衰减提示词中没有描述光线的结果:均匀的环境光,没有阴影方向修改前修改后
这两张之间只改了光线层,人物描述、服装、镜头参数完全一致。拖动中间的滑块对比。

注意光线层做到了一件多少个「高清、写实、8k」都做不到的事:它给了画面一套物理逻辑。现在有一个光源确实存在于某个具体位置,画面里所有东西都与之自洽。

第四层 · 镜头

镜头层决定一张图看起来是「拍出来的」还是「生成出来的」。真实照片是用真实光学系统拍的,而真实光学系统有它特有的形变规律。

镜头层

85mm 镜头 f/2 拍摄,取景从大腿中部往上,机位在胸口高度, 浅景深,背景柔和虚化,透视自然,没有广角畸变

商业人像的安全默认值是 85mm f/2,除非你清楚为什么要改,否则不用改。

拆开看:

  • 焦段。85mm 是商业人像的主力焦段——背景压缩得恰到好处,面部比例不变形。35mm 偏环境叙事、时尚大片感。24mm 及更广会让脸变形,偶尔是刻意为之,多数时候不是。
  • 光圈。f/2 主体分离清晰;f/8 能让衣服从前到后都实,这一点对商品图比想象中重要得多——虚化得再好看的袖子,也是顾客看不清的袖子。
  • 机位高度。「胸口高度」或「略低于视线」。这一句话能避开默认输出里常见的俯视角度。
  • 取景范围。「大腿中部往上」「全身」「胸像」。你不写,模型替你决定。
加入镜头层之后:85mm f/2,面部比例自然,背景被压缩分离提示词中没有镜头参数的结果:广角观感,面部比例被拉伸修改前修改后
只改了镜头层。人物、服装、光线的文字一字未动,差别完全来自光学。

拼起来看

同样一个需求,把四层都写全:

完整的四层提示词

二十七八岁的女性,深棕色齐肩发,表情平静放松,视线略微偏离镜头看向左侧, 站姿重心落在后脚。她穿着宽松版暖米色罗纹针织毛衣,粗针美利奴羊毛,落肩设计, 下装是直筒深色牛仔裤。柔和的定向自然光从画面左侧的大窗户射入, 光线在素色石膏墙面上柔和衰减,午后偏暖的色温。85mm 镜头 f/2 拍摄, 取景从大腿中部往上,机位在胸口高度,浅景深。

约 120 字。不是越长越好——这里每一个词都在指定一项视觉属性。
完整四层提示词的出图结果,人物、服装、光线、镜头都已指定「漂亮模特穿着米色针织毛衣,高清,8k」的出图结果修改前修改后
左:开头那条提示词。右:四层版本。同一件商品,同一个模型,同一组生成参数。

差别不算细微,而这里面没有一点来自更好的工具或更长的质量词列表。它只来自把四个交给模型的决定,换成了四个自己做的决定。

一个可以直接套的模板

把具体内容抽掉,剩下的就是一个填空结构,适用于大部分时尚和美妆人像的场景。

通用模板

[年龄 + 体态],[发型],[表情],[视线方向],[姿态 + 重心]。 她穿着 [服装:版型 + 颜色 + 材质 + 工艺细节],搭配 [其他单品]。 [光线软硬] 的光从 [方向] 射入,[光源],[背景表现],[色温]。 [焦段] 镜头 [光圈] 拍摄,[取景范围],机位在 [高度],[景深]。

逐个替换 [方括号] 部分。如果某一格你填不出来,说明那个决定你还没做——而不是该交给模型做。

两个见效很快的习惯:

把管用的那一层留下来。某段光线描述出的效果你满意,就把这段文字原样复用到整组拍摄里。多张图之间的一致性来自复用文字,不来自运气。

光圈按用途定,不按好看定。浅景深好看,但它会糊掉衣服细节。对商品详情页来说这是笔亏本买卖;对生活方式或社交内容的图,它才是对的选择。

接下来看什么

四层框架是地基。每个具体场景还会在它之上叠自己的约束:

如果整篇只记一句话:提示词不是许愿,是规格说明书。你没写的每一层,模型都会拿平均值填上——而平均值,正是「一看就是 AI」的来源。

相关教程

纯色影棚背景下的 AI 模特穿着米色针织衫,按电商商品图的构图与打光生成

电商实拍

能真的挂上商品详情页的 AI 模特图

商品图是拿来卖货的,不是拿来好看的。做电商图时,光圈、背景、构图要怎么改,以及一个很少有人提的退货风险。

同一个 AI 模特换了四套衣服,面部特征与打光在每一张里都保持一致

电商实拍

怎么让整个店铺用同一个 AI 模特

同一条提示词,每次跑出来都是另一张脸。这篇讲清楚人物为什么会漂,以及「基准图 + 参考图 + 锁定文案」这套能真正撑住二十张图的做法。

同一位模特同一件衣服的两种渲染并排对比,左边是干净写实的商业风格,右边是更风格化的电影感

工具对比

做时尚人像,ChatGPT 和 Midjourney 该用哪个

不是「谁更强」,而是「谁适合这活」。两者在指令遵循、人物一致性、颜色准确度和迭代方式上的结构性差异,以及什么时候答案是两个都用。