电商实拍9 分钟阅读
怎么让整个店铺用同一个 AI 模特
同一条提示词,每次跑出来都是另一张脸。这篇讲清楚人物为什么会漂,以及「基准图 + 参考图 + 锁定文案」这套能真正撑住二十张图的做法。

好不容易跑出一张能用的图:脸是对的,光是对的,衣服的质感也在。于是换一件毛衣,同一条提示词再跑一遍——回来的是另一个人。年龄差不多,发色差不多,气质也差不多。但不是同一个人。
二十个 SKU 跑二十遍,就是二十个模特。这种图挂上去,比不挂还糟:买家在列表页往下滑,根本分不清这是一个品牌,还是随手拼的图库素材。
这是 AI 服装图里最难的一件事,也是大多数教程直接跳过的一件事。下面说清楚它到底为什么会发生,以及怎么解决。
提示词没变,脸为什么会变
一条文字提示词描述的不是一个人,而是一批人。
你写「二十七八岁的女性,深棕色及肩发」,模型收窄到的是所有满足这个描述的脸——那仍然是一个很大的集合。每次生成都从这个集合里重新抽一个点。你的提示词里没有任何东西能把其中某一张脸和另一张区分开,所以模型没有理由给你同一张。
这一点值得多想一层,因为它解释了为什么最直觉的办法没用。继续加五官描述——「高颧骨、小鼻子、下颌线清晰」——确实能把范围收得更窄,但永远收不成一个点。你会得到一群长得更像的女性,而不是同一个女性。而且正如四层框架那篇里说的,五官形容词堆多了会把出图推向美颜滤镜那一片,反而在另一个维度上把图搞砸。
真正管用的三个机制
纯文字锁不住人。下面三件事可以,而且能叠加。
| 机制 | 锁住什么 | 什么时候失效 |
|---|---|---|
| 参考图 | 面部结构、发型、体型 | 姿态或角度变化太大 |
| 同一个会话 | 隐式地锁住一切 | 开新会话,或轮次太多 |
| 锁定的文案 | 光线、镜头、背景 | 不失效,但它锁不住脸 |
下面这套流程三个都用上。少任何一个,漂移都会回来。
第一步:做一张基准图,把它当资产对待
后面所有图都依赖这一张,所以这里值得花真功夫。跑十到十五张变体,挑真正最好的那张,而不是第一张能看的。
A woman in her late twenties with shoulder-length dark brown hair, relaxed neutral expression, looking directly at the camera, standing squarely with both arms relaxed at her sides. She wears a plain fitted grey crew-neck t-shirt and straight-leg dark denim. Soft even daylight from a large window at camera left, gentle falloff across a plain plaster wall, neutral colour temperature. Shot on 85mm at f/4, framed from mid-thigh up, camera at chest height, face fully sharp and clearly visible.
这里有两个刻意的选择。
正视镜头、中性站姿。这和成图的建议正好相反——成图里视线偏离镜头才更像时尚大片。但基准图不是拿来发的,它是一张参照表。模型需要清楚地、正面地看到这张脸,才能在后面复用它。
用 f/4,不用 f/2。浅景深会把面部细节糊掉。你要的是脸足够锐利,让模型有更多结构可以抓。
第二步:之后每一次生成都带上基准图
这是杠杆最大的一步,也是最多人从来没做过的一步——因为大家习惯了打字,而不是传图。
在 ChatGPT 里把基准图传上去,然后把新场景写成「修改指令」,而不是重新描述一遍:
Using the attached image as the reference for the model’s identity, generate a new photograph of the same woman — same face, same hair, same build. Keep the lighting and camera treatment identical to the reference: soft daylight from a large window at camera left, plain plaster wall, 85mm at f/4, camera at chest height.
Change only the garment: she now wears an oversized warm-beige ribbed knit sweater in chunky merino wool with dropped shoulders, hem falling just below the hip.
结构比措辞重要。每一条后续提示词都应该包含三段,顺序固定:
- 人物锚点——「和参考图里同一个人,同样的脸、同样的头发、同样的体型」
- 锁定层——光线和镜头的文案,从基准图那条原样复制,绝不改写
- 唯一的变化——这张图里唯一不同的那件事
锁定层一定要逐字复制。把 soft daylight from a large window at camera left 改写成「柔和的自然侧光」,对模型来说就是另一个意思,背景会跟着变。
第三步:能在一个会话里做完,就别开新的
在同一个会话里,模型会带着前面几轮的上下文,这会持续强化参考图的作用。整批图在一个长对话里跑完,比同样的提示词分二十个新会话跑,一致性明显更好。
但这有上限。轮次多到一定程度,早期上下文会被压缩掉,漂移就回来了。发现脸开始走样时,别在那个对话里硬撑——开一个新会话,重新传基准图。带参考图的新会话,比不带参考图的长会话稳得多。
漂移会在哪里回来
就算三个机制都用上,有些情况仍然会崩。这几种是可以预判的。
姿态变化太大。从正面站姿换成侧身坐姿,等于要求模型重建一块参考图里根本没有的面部几何。解法:做一组小的参考集——正面、四分之三侧、正侧各一张——生成时挑角度最接近的那张传上去。
近景特写。全身构图下看着一致的脸,裁成半身特写往往就不一致了,因为特写会暴露参考图从来没锁住的细节。解法:特写要从特写基准图生成,不要从全身基准图生成。
反复在改图上再改图。改图的改图的改图,小偏差会一路累加,最后跑到别的地方去。解法:永远回到最初那张基准图,不要链式修改。
说清楚这套能做到什么程度
对这套流程要有准确的预期。它能给你的是:整个店铺里模特是可辨认的同一个人——一致到买家在列表页浏览时,读到的是一个品牌、一张脸。
它给不了你像素级完全相同的面部几何。两张图凑近了比,眼皮的弧度、嘴角的位置总会有细微差别。真实摄影在不同帧之间也有同样的浮动,这也正是这套做法在商业上站得住的原因。
有一种情况例外:如果你要做的是围绕单一固定模特的品牌资产——首页那张脸、邮件头图、包装上的形象——对漂移的容忍度会陡然下降。这几张关键图应该在同一个会话、同一张基准图、一次性跑完。
流程速查
- 做基准图:中性姿势、正视镜头、均匀光、f/4、脸要锐。认真挑,存原图。
- 之后每一张:传基准图,写成「人物锚点 → 逐字复制的锁定层 → 唯一的变化」。
- 脸还稳就留在同一个会话里。开始走样就换新会话重传基准图,别硬撑。
- 要拍非正面构图之前,先备好多角度参考集。
- 铺图之前,整批拼成一张图一起看。
底层道理和四层框架是同一个:你没指定的部分,模型一律用平均值填。而人物身份根本无法用文字指定,所以它只能用图来提供。一旦你不再试图「描述」一张脸,而是直接「给」它一张脸,这个问题就变得可控了。
具体落到商品详情页——背景一致性、平台构图规范这些——见商品图专篇。
相关教程

