Stop writing dozens of vague prompt lines! A battle-tested short prompt framework dissecting 17 visual dimensions (lighting, color, depth of field, framing, motion, texture) with an interactive prompt builder.

在做影视分镜、电商视觉或多风格设计时,我们经常需要把一张图片(参考图)中的某些感觉迁移到另一张图片(底图)上。 但过去常见的做法通常是让 AI 或自己手动写出极度冗长繁琐的描述:分析是金色侧逆光、几十毫米镜头、光圈多大、景深多少、透视畸变多少……
实测结果发现: 这么复杂的提示词不仅极其累人,而且生图模型往往在过多技术参数中迷失,引入很多不需要的多余细节。经过大量对比实测,“把提示词写短,直接利用模型本身的图像语义对齐能力”,反而能够极快地拿到高质量的方向稿!
这套提示词模板的核心逻辑极其简单利落——明确告诉大模型:从参考图提取什么维度,并严格锁死底图的主体与核心内容。
💡 使用建议:在 Midjourney、Flux、GPT-Image 2.5 或 Qwen-Image 2.1 中,将参考图作为图一(Image 1),底图作为图二(Image 2),直接输入此短提示词即可。
为了严谨验证“短提示词”的边界,南鸢选用了一张高难度的女孩窗边阅读照片作为标准底图,固定单变量逐一测试了 17 种不同维度的风格迁移效果:

| 分类大项 | 细分视觉维度 | 测试效果归纳 | 短提示词调用关键词 |
|---|---|---|---|
| 光线与调色 (4项) | 光影、色彩调色、曝光、影调对比 | 方向极其明确,快速改变整幅画面基调 | 光线氛围与明暗关系、色彩倾向与色彩分级 |
| 成像与质感 (6项) | 成像质感、后期质感、锐度清晰度、材质、空气感、颗粒噪点 | 空气感与后期质感明显;锐度与材质表现证据较弱 | 后期处理质感、空气透视、胶片颗粒 |
| 摄影与空间 (5项) | 景深焦外、镜头感、运动表现、构图、机位 | 涉及空间重构!容易脑补背景、下半身或全画幅拖影 | 景深与焦外特征、摄影机机位、构图方式 |
| 造型与媒介 (2项) | 人物造型风格、视觉媒介 | 适合探索新方向,会直接换服装配件或改插画风格 | 人物造型风格、媒介与笔触绘制方式 |
只看单张出图,画面变好看了很容易被误判为“迁移成功”。但在真实生产中,我们必须把【参考图】、【底图】与【生成图】三张图放在一起严格对照, 回答两个致命问题:第一,原先想借的特征有没有借到?第二,为了得到这个变化,结果把什么不需要的东西也一起带过来了?

🔍 实验发现: 只看光影时,就能明显感受到画面氛围的质变。色彩迁移将环境推向参考图的蓝青冷色调,但人物面部肤色仍保留了一丝暖色,避免了死白或偏色。
⚠️ 连带代价: 词分成了 17 项,不代表模型是 17 个互不影响的独立旋钮。比如“曝光”和“影调对比”两项几乎都走向了金色高光、深暗部与偏绿阴影,而“成像质感”顺手改为了蓝青色调。

🔍 实验发现: “后期质感”借来的是高光泛开与一层灰雾;而“空气感”则把背景推成了青白色的朦胧空间,甚至直接激发出斜向的丁达尔光束!两张虽然都让人感觉“柔”,但一个偏滤镜式扩散,一个偏环境散射。
⚠️ 警惕脑补: 在“景深”迁移结果里,人物主体清晰、背景出现大片散景;然而参考图里的室内暖色吊灯和一个模糊的背景人影,也被模型“顺手”照搬进了新画面的窗外!

🔍 实验发现: 参考图是贴近地面的超低角度仰拍,生成结果确实将视角降到了桌子下方:桌腿被放大,人物退到画面深处。
⚠️ 严重翻车点: 原始底图只有半身,而低仰拍机位必然需要显示人物下半身。模型便顺理成章地“脑补”出了牛仔裤和运动鞋——而且下装款式几乎直接照抄了参考图!这启示我们:做连续剧集或角色资产时,绝不能只靠半身图就期望模型机位自动推算正确。

🔍 实验发现: 头发和手臂带有漂亮的横向拖影,极富动态张力。但仔细比对发现,背景原本静止的窗户和书架也被拖成了摇摄模糊。
⚠️ 启示: 生成模型捕获到了“画面要有运动感”,但无法自发分清“谁在动、谁静止”。做动态视觉方向稿非常适合,但直接作为交付成品仍需局部涂抹(Inpainting)修复背景。

预设希望弱化细节让画面变得柔和,但生成图里的发丝、面部毛孔和毛衣针织纹理反而更清晰。“出图了”绝不等于“迁移成功了”,单靠“锐度”词很难让模型做单纯的减法。

皮肤高光稍微柔润了一些,但毛衣依然是原先的针织质感。眼前的微弱变化更接近泛光柔化,无法确凿证明模型真正借到了参考图特有的表面材质反射。
短提示词公式中的【维度】不仅可以填单一词条,还可以将几个相互关联的维度进行组合叠加。 例如在做电影调色质感迁移(LUT 迁移)时,单写“调色”可能改变不够彻底,把“光线氛围”、“明暗关系”、“色彩倾向”与“后期调色质感”串联起来,效果将产生质的飞跃:

💡 效果点评: 叠加后的成图不仅准确借到了参考图的高级胶片色调与光影反差,而且因为后半句严格限定了“保持构图和内容不变”,原本容易发生漂移的室内桌椅摆放和女孩姿态都得到了完整保持!
在摸索出短提示词之前,南鸢曾尝试过两套方案:直接用目标图和原图进行迁移,或者先做一张前后调色对比图再让模型学习。这两套方案的实际出图效果均不如预期:

两张图直接迁移缺乏清晰的维度指引,模型往往在“复制构图”还是“复制调色”之间摇摆不定,容易造成局部变色、脸部失真的非预期结果。

试图让模型先理解对比图调了什么再进行迁移。虽然数值上更接近调色目标,但在画面整体审美和连贯性上依然无法达到直接使用的标准。
先想好你到底想要什么:是逆光光感、冷暖色调、空间散景,还是造型服装?一次只借 1 到 2 个核心特征,命中率最高。
直接使用“将图一的【XX】迁移到图二,保持图二的主体身份与主要内容”,快速生成第一版。肉眼看大方向是否到位。
若出现机位变动导致下半身被脑补、背景虚化带入了额外人影,第二轮再针对性加上“保持背景不变”、“保持原有服装不变”等具体补丁。两三轮迭代即可稳定交付!

Compact 7B Single-Stream DiT matching monolithic commercial flagships! Deep dive into native RGBA layer synthesis, up to 10 reference asset composition, and 5 interactive workshops.

Full Prompt OCR transcription of 26 original cases, dual-engine visual architecture, and 3 interactive workshops: 4-round inpainting sandbox, Flare vs Sunburst matrix, and poster studio.

End-to-end workflows: bouncing sticker GIFs, 3x3 meme sheets, jitter-free commercial sweeping lights, SKU replacement, apparel try-on, perfume refraction, and 3D packaging mockups.
Explore multi-agent workflows, enterprise RAG, and local LLMs.