

前几天回了趟山西老家,去大同转了一圈。善化寺、关帝庙、城墙、应县木塔,一路拍了不少古建。
建筑本身很好看,但自己拍的照片总差点意思。
直接发出来,说实话,配不上这些建筑。
于是我就想:能不能做个工具,把这些照片变成真正好看的海报?
像杂志编辑做的那种有排版、有字体设计、有文化信息、建筑主体被认真对待过的海报。

做完之后,效果超出预期。于是把它整理成了一个开源 Skill:
Yingzao · 营造(https://github.com/op7418/guizang-yingzao-skill)。
下面讲讲它做了什么、好在哪里,以及为什么能做到这个效果。
在讲细节之前,先放几组对比图。左边是原图,右边是生成的海报。

这是在大同城墙上透过松树拍的。原图光线不错但构图比较随意,前景的树枝占了大半画面。
海报把城楼提取出来做了主体,加上了"大同城墙"的字形设计、始建年份 1372、四座城门的名字,整张图的信息密度和视觉完成度完全不一样了。

这是大同东南邑的既下山酒店。原图是个标准的建筑摄影角度,水面倒影很漂亮,但就是一张普通的旅行照。
做成海报之后,加了竖排的"东南邑"、中英文混排的标题,建筑被重新处理过——纸质纹理、分区调色,像一张正经的建筑杂志内页。

这张是大理喜洲的紫藤花和飞檐。原图本身就很漂亮了,但海报做了一件有意思的事:
把整个画面转成了薰衣草紫的统一色调,标题"喜洲"用的是带石刻质感的字形,右侧小字"古镇一角"竖排排列。
和原图放在一起,你能看到照片和文字融合得很好。
风格多样,不撞款
市面上很多海报 Skill 的问题是:做出来的东西长得都一样。
同一套模板、同一种字体、同一个配色,发出去一眼就能看出是同一个工具生成的。

营造有一套完整的 Design Token 系统,内置了几十个经过验证的 Recipe(风格配方),每个 Recipe 对应一套字体谱系、材质层级、配色逻辑和排版骨架。
生成海报的时候,它会先分析你的照片:
是正立面还是仰视?是大场景还是构件特写?是暖光还是冷调?
然后从 Recipe 库里匹配一个兼容的方向。

你看这四张:善化寺藻井用的是古纸底、木刻字形;
关帝庙木构用了半靛蓝半石灰的分区底色,"木构"两个字被斗栱遮挡了一部分;
大理上关的白族民居直接做成了青花瓷一样的蓝白色调;
边靖楼则是朱红大字、竖排信息栏,完全不同的气质。
每个 Recipe 里的字体、材质、色场、排版动作都经过兼容性检查,互相不打架。
组合起来可能有上千种变化,但每一种都是视觉上说得通的。

自动检索文化背景
海报上的文字不是随便写的。
你给它一张善化寺山门后檐的照片,它会识别出匾额上写的"威德护世"。
检索出这是明嘉靖七年(1528)潞城王所书,然后把这些信息排进海报里。

你给它一张应县木塔的照片,它会标注出"1056 · 辽 · 清宁二年"、"五层六檐 纯木楼阁"。

这些信息都经过事实分级——照片里能看到的、可以核实的、用户确认的才会写进海报。
它不会因为你拍了一座古建就自动编一段"千年古刹,历经沧桑"之类的废话。
对旅行场景来说这特别有价值。
发一张漂亮的海报到朋友圈,朋友不光看到好看的画面,还能顺带了解这个建筑的年代、规制、构造特点。
分享变成了一种轻量的文化传播。
原图对比拼图
如果你想给朋友展示"我的照片被做成了什么样",可以选择生成原图对照拼图。

左边原图,右边海报,放在一起冲击力很强。
原图里沙溪兴教寺山门的两尊金刚力士像,在海报里被提取出来,用灰调和暖红对比呈现,背景转成了古纸纹理,配上"兴教寺"的大字标题。
你能一眼看出海报保留了原图的所有真实细节,但视觉层级完全重建了。
当然也可以不要拼图,只出海报。这个随你选。
多图融合,不是拼贴
支持把多张照片融合成一张海报。
这里要强调的是"融合",不是把几张图缩小了往网格里一塞。

比如这张大同东南邑的小南唐茶食店。
它把店铺的灯笼、室内陈设、甜品特写、茶碗纹理这些来自不同照片的元素,提取出来之后放进了同一个视觉空间。
共同的古纸底色、一致的光线方向、有明确的前后层次关系。
看起来像一个场景,不像四张图硬拼在一起。
不只是古建
虽然我做这个 Skill 的起因是古建筑照片,但它的适用范围比想象的宽。

这是在大同一家咖啡馆拍的沙棘美式。
我拿来测试的时候发现效果意外地好:
暖橘色调、沙棘果实作为点缀元素、"沙棘美式"的字形带着饮品的圆润感。
完全不像古建海报,但出品质量一样在线。
食物、饮品、手工器物、文化店铺、暖光室内,这些"亲密尺度"的场景它都能处理。
只要照片有一个真实的主体和在地感,它就能找到合适的方向。
甚至有视频。
在生成图片以后,如果你想给这两张图片做一个动态视频的话。
可以要求它生成一张带有九宫格的分镜,以及搭配的提示词。

你只需要把这个分镜图片和提示词发给 Seedance 2.0 或者是 MiniMax H 3。
它就能帮你做一个对应时长的海报分享视频了。
比如这段,就是用喜洲古镇的那张照片的结果做的视频。
讲完了"它能做什么",简单说说"它为什么能做到"。
整体思考,重建视觉世界
很多海报工具的做法是:照片当背景,上面叠一层半透明遮罩,放上标题和小字。
营造的做法完全不同。它同时向图像模型输入三样东西:

- 校正后的原图:负责建筑的真实身份,屋坡、飞檐、匾额、轮廓这些"身份锚点"必须保留
- 一张主导参考图:负责完整的视觉机制:主体怎么处理、背景怎么参与、图文怎么互动
- 一张排版垫图:负责文字的位置、大小、层级、遮挡关系。
- 一段提示词:负责告诉模型如何将这几个图片中的样式提取出来,同时还需要补充哪些样式。

图像模型的任务是把这四样东西融合成一个统一的画面。
主体的语义抠取、背景的重建、材质的分区处理、文字和建筑轮廓的遮挡关系,这些都在同一次生成里完成。
所以你看到的海报里,飞檐压住了标题的一角、柱子穿过了字的中间、建筑轮廓和色场自然衔接。
字体不是"选个宋体"
字体是这类海报的灵魂,所以每张海报的标题字形都是单独设计的。
碑刻、雕版、人文宋、几何黑体、隶意还是实验字。
然后逐字定义宽窄比例、笔画对比、起收笔特征、重心高低、字腔大小、表面媒介。

比如关帝庙"木构"这两个字:字形偏向构筑型宋体,横竖对比明显,笔画有石刻质感,字腔较开(因为背景是高密度的斗栱纹样,字形太复杂会互相打架)。
而且"木"字的一部分被斗栱实体遮挡了,这种遮挡是提前设计好的,不是意外裁切。

小字用的是另一套字族,和标题建立层级差异。
不会全篇统一用一种字体。
丰富但不混乱
风格多不等于乱。营造有一套明确的约束体系:
每张海报只选一个主构图、一个主体容器、一个主材质、最多一个辅助材质、一套有角色差的字体、一个配色来源、一个主要空间冲突、零或一个语义装饰。
配色优先从照片里提取:建筑的漆色、砖石、天空、植物、灯光。
不会无中生有地加一个和照片毫无关系的强调色。

装饰也是克制的。
只有来自照片可见内容、同时承担两项以上视觉任务、并且锚定到真实主体或标题的装饰才会被加入。
不会因为是古建就撒满祥云纹。
这套约束体系是我在反复调试中逐渐建立的。
一开始也试过给更多自由度,结果就是效果时好时坏、风格飘忽不定。后来发现:
限制越明确,出品越稳定。
给模型一个被验证过的框架,它的任务从"设计"降级成"在框架内发挥",成品率就上来了。
五、最后
做类似设计 Skill 的过程中,我一直在想一个问题:
AI 在视觉创作里应该扮演什么角色?
我在营造这个 Skill 上有了一些新的想法:
程序负责它真正擅长的事:测量、字体覆盖检查、碰撞检测、对齐、几何校正、输入纪律;
图像模型负责它真正擅长的事:语义理解、空间重构、材质渲染、光线处理、图文关系。
生成之前把方向想清楚,生成之后把判断权交还给用户。
不自动评分、不自动重生成、不消耗额外的额度。
成图直接交给你,你觉得哪里不对,告诉它,它再定向修改。

这个工作方式和很多"全自动"工具不一样。
但我觉得在旅行海报这个场景下,它是对的。
因为每张照片背后都是一段真实的经历,每栋建筑都有自己的身份。
你不会希望一个工具自作主张地把善化寺的屋脊"优化"成另一栋楼的样子。
最后说回这次大同之行。
站在善化寺大雄宝殿里仰头看那个八角形藻井的时候,我就在想,这种东西用手机很难拍好。
仰角太大、光线太暗、细节太密。
但正是因为难拍,做成海报之后才觉得值。
那些在现场让你愣住的瞬间,被认真对待之后变成了可以分享的东西。
如果你也有一堆旅行照片不知道怎么处理,试试看。
GitHub:https://github.com/op7418/guizang-yingzao-skill
跟你的 Agent 说:
帮我安装这个 Skill:npx skills add https://github.com/op7418/guizang-yingzao-skill --skill yingzao
安装后直接说自然语言就行:
需要注意的是,这个目前非常依赖 GPT-image 2.0 模型,所以推荐在 Codex 里使用。
用 $yingzao 把这张大同古城的照片做成一张海报。
如果觉得有用,帮我点个赞或者转发给你身边爱拍照的朋友。也期待在评论区看到你用它做的海报。✦
复制本文链接 文章为作者独立观点不代表优设网立场,未经允许不得转载。








发评论!每天赢奖品
点击 登录 后,在评论区留言,系统会随机派送奖品
2012年成立至今,是国内备受欢迎的设计师平台,提供奖品赞助 联系我们
用户体验增长
已累计诞生 795 位幸运星
发表评论
↓ 下方为您推荐了一些精彩有趣的文章热评 ↓