AI 知识图解工作流文章头图 导语

我第一次想做这套知识图解,并不是因为 AI 生图看起来很新鲜,而是因为我在学习 AI 相关知识时,经常被一些专业名词卡住。Agent、RAG、MCP、上下文、Token……这些词单独拆开,好像都能找到定义,但当它们同时出现在一篇文章或一张架构图里,理解难度就会突然上升。很多时候,我明明看懂了每一句解释,却仍然没有在脑中形成一个清晰的结构。读懂了文字,并不等于真正建立了理解。

所以我想换一种方式。如果可以把专业概念拆成具体的角色、动作和关系,再通过流程图、对比图或者生活化场景表现出来,理解它们可能会容易很多。比如解释 Agent,与其继续堆叠“自主决策”“任务规划”“工具调用”这些术语,不如先把它还原成一件具体的事:你告诉它一个目标,它判断下一步应该做什么,选择合适的工具,执行后检查结果,再决定是继续、调整,还是回来向你确认。当这些动作被画成一条可以看见的路径,抽象概念也就开始有了形状。

于是,我准备做一个 AI 知识图解 Skill。我希望以后只需要提供一个 AI 术语、一段学习笔记或者一篇文章,它就能先判断内容重点,再规划叙事结构,最后生成一组风格统一的图文卡片。为此,我提前找好了插画、猫咪形象和知识图解排版的参考图,也定义了女孩、猫咪、配色、字体、留白和输出比例。当时我把整个过程想得很顺:先梳理内容,再生成插画,最后加入文字,一套五张的知识图解应该很快就能完成。

实际过程却比预想复杂得多。前后尝试了三次,同样是短发女孩和白色猫咪,每次生成出来的形象都不完全相同;已经明确要求“只修改猫咪,其他内容不动”,模型仍然可能同时改变人物细节、页面边距或者其他元素。制作过程中还遇到了网络连接中断,部分流程只能重新连接、重新确认。为了调整角色、字体、留白、页边距和局部插图,最终五张图产生了十多个版本,整个过程前后花了四个多小时,使用额度也比预期消耗得更快。

这篇文章记录的不是一份标准教程,也不是一次“AI 一键出图”的成功展示。我更想讨论的是:当一个高度依赖感觉的视觉需求被放进 Skill,我们究竟需要把什么写进去?提示词为什么越写越长,结果仍然会漂移?一套偶尔能生成好图的流程,要经过哪些变化,才可能成为可以重复使用的产品能力?

一、我真正想解决的,从来不是出图问题

1.1 表面上是在生成图片,实际是在降低理解成本

如果只看交付,这个需求很容易被概括成一句话:把 Agent 做成五张知识图解。但读者需要的不只是一组好看的卡片,而是借此快速理解陌生概念。衡量结果因此不能只问“像不像参考图”,还要追问:读者能否迅速抓住主结论?插画是在解释关系,还是只负责装饰?生活化比喻有没有牺牲概念边界?

以 Agent 为例,如果只把它解释成“更聪明的聊天机器人”,读者可能会记住一种容易理解却不够准确的说法。Agent 的关键并不只是回答得更好,而是能够围绕目标判断下一步、调用工具、执行动作、观察结果,再决定继续还是调整。画面越精致,如果传递的是错误直觉,反而会让误解变得更牢固。

所以,这组图片的第一项验收标准不是“好看”,而是有没有降低理解成本。读者看到第一页时要知道本文在纠正什么误区,看到流程页时要理解 Agent 为什么能够推进任务,看到最后一页时还要知道它并不适合所有场景。视觉表达服务的是理解路径,而不是单独存在的装饰效果。

1.2 知识图解不是给文字配一张插画

普通配图通常在文字已经成立之后增加氛围,知识图解却需要介入内容结构本身。原始材料可能是一段长文、几个关键词或一组截图,里面同时存在定义、机制、例子、限制和延伸概念。它们不能被平均塞进五张图,而要先判断哪一个误区最值得纠正,再决定使用对比、流程、场景还是关系图。

这次制作最终选择了“会聊天,不等于会办事”作为主线。第一张建立直觉,第二张对比聊天与推进任务的两种工作方式,第三张解释“理解目标—计划下一步—选择工具—执行—观察—调整”的循环,第四张说明模型、工具、指令与护栏怎样共同组成 Agent,第五张补充适用边界。五张图不再是五个平行知识点,而是一条逐步收紧的理解路径。

一旦叙事主线发生变化,插画任务也会跟着变化。女孩拿着“目标”卡片,猫咪沿任务路径前进,搜索、工具和结果构成行动链,这些都不是为了让页面显得可爱,而是在帮助读者看见抽象概念中的动作和关系。知识图解的难点因此不只在画面,而在于先把内容翻译成可视化结构。

1.3 需要产品化的,是一条知识翻译链

这条链路至少包含六个环节:识别核心问题、选择切入点、保证概念准确、把抽象关系转成视觉隐喻、规划逐页叙事,再按统一规则交付。任何一环失控都会反映在图片上,但根因未必出在生图阶段。

如果核心问题选错,五张图会做得完整却没有重点;如果概念边界没有确认,生活化比喻会把复杂问题讲偏;如果角色和版式没有形成规范,内容即使正确,整套图片仍然会显得像临时拼在一起。真正要复用的,是前面的判断、过程中的约束和后面的验收。

因此,这个 Skill 更接近一条知识翻译生产链,而不是“输入一个词,输出几张图片”的快捷按钮。出图只是最后可以看见的交付,前面那些不容易被看见的选择,才是产品化真正要保存的部分。

二、第一次试做:参考图很明确,为什么结果还是会漂移?

2.1 十张参考图,不等于一份视觉规范

制作前,我准备了两组共十张视觉参考。第一组主要说明插画气质,其中最右侧的猫咪用于参考 IP 形象;第二组用于说明知识图解的内页版式。我希望最终画面呈现日系极简手绘风,保持白底和大面积留白,以粗黑轮廓为主,用蓝色和黄色做重点强调,女孩与猫咪作为贯穿整组内容的固定角色,单页采用 3:4 竖版。

视觉风格与猫咪IP参考

图 1:视觉参考分别回答了“线条是什么气质”和“猫咪大致长什么样”,但还没有构成可执行的视觉规范。

知识图解内页版式参考

图 2:版式参考提供了标题层级、卡片结构和信息密度方向,但其中的人物、字体和色彩并不等于本次项目的正式规范。

这些参考对人类设计者已经能传达大致方向,对模型却仍然是一组需要重新解释的信号。有的参考强调涂鸦线条,有的更接近平面海报;猫咪参考拥有独特的大眼造型,版式参考又使用另一套人物和卡片系统。若只说“参考这些图的风格”,模型必须自行判断究竟要继承线条、配色、人物比例、版式还是知识密度。

问题不在参考图太少,而在它们没有被分工。参考图能够告诉模型“可能接近什么”,却不会自动说明“图 1—4 只参考线条、图 5 只参考猫咪、图 6—10 只参考信息排版”。当多个参考之间存在差异时,模型会在每次生成时重新权衡,局部结果都说得通,放在一套内容里却可能持续漂移。

2.2 第一版已经很像一套完整作品

第一次输出并不算失败。封面、工作方式对比、Agent 循环、旅行规划场景和系统组成已经形成一套完整内容。女孩拿着蓝色卡片,白色猫咪拖着工具箱,蓝、黄、绿作为强调色贯穿页面;标题、解释和插画也已经组合成可以浏览的知识卡片。单看最终预览,它甚至很像一个已经完成的项目。

第一次尝试生成的结果

图 3:第一次尝试已经生成了一套完整作品,但流程中途因网络中断结束。

问题出现在继续修改之后。为了纠正猫咪眼睛、字体、标题位置和页边距,我开始反复发出局部指令。同样的角色描述再次生成时,女孩的五官和身体比例会变化,猫咪的眼睛和头身关系也会被重新解释。某些修改解决了眼前问题,却顺手改变了原本满意的部分;每一轮更像是在版本之间交换问题。

这让我看清了“完成一套作品”和“建立一条工作流”的区别。作品只需要在当前内容里成立,工作流必须在换一个概念后仍能运行,并且说明输入是什么、在哪里确认、哪些内容不能变化、失败后怎样恢复、达到什么条件才算完成。如果下一次制作 RAG 或 MCP 仍然要从头解释角色、字体和版式,这次经验就还没有进入 Skill。

2.3 相同要求,可以生成同一类角色,却不一定是同一个角色

生成式模型不会按照固定模板逐项装配画面,而会综合文字、参考图和当前上下文,重新生成一组视觉结果。相同要求可以稳定“短发女孩、蓝色裤子、白色猫咪、极简手绘”等类别特征,却不保证每次都是同一个女孩和同一只猫。详细描述只是缩小结果范围,发卡位置、脸型、眼距和身体比例仍然存在解释空间。

这对探索风格是优点,对连续内容却会直接变成一致性成本。五张图片中的女孩如果只是“都属于短发女孩”,读者仍然会感觉角色换了;猫咪如果每页都拥有白色身体和黑色轮廓,但眼睛、胡须和身体比例不同,也很难形成稳定 IP。所谓“角色一致”,不能只停留在类别相似,还要明确哪些识别特征必须保持。

局部编辑同样不是传统设计软件里的图层锁定。“只修改猫咪,其他内容不动”是一项约束,不是像素级保证。模型为了让新结果在视觉上保持自洽,可能同时调整附近线条、留白、人物甚至页边距。网络中断又会进一步放大这种漂移:如果没有文件名、版本号和基准图,重新连接后很容易从错误版本继续。表面上丢失的是一段对话,实际丢失的是尚未显式保存的制作状态。

三、从反复重做到分阶段确认:工作流是怎样形成的

3.1 第二次尝试没有完成,却留下了最重要的阶段成果

第二次尝试不再直接从五张成图开始,而是先生成女孩和猫咪的 IP 形象,再制作内页插画与封面样图。流程后来同样因为网络中断没有走完,但这一轮并非没有价值:女孩和猫咪的整体形象已经接近我的预期,特别是黑色短发、芯片形发卡、蓝色阔腿裤,以及白色猫咪的大眼和项圈,开始形成可以继续使用的识别特征。

第二次尝试的阶段结果

图 4:第二次尝试在角色设定阶段达到了预期方向。虽然流程没有完成,但它提供了可供下一轮引用的 IP 基准。

第三次尝试并没有直接沿用第二次生成的角色图片,而是把它作为视觉参考重新生成。这一点看似只是制作方式上的差别,实际暴露了“参考”与“资产”的边界:一张参考图可以帮助模型接近某种形象,只有被明确确认、命名并在后续反复引用的版本,才真正成为角色资产。

第二次尝试最重要的成果因此不是某一张可以直接交付的页面,而是让工作流第一次拥有了阶段结果。即使后续中断,角色方向也不必重新从零探索。对 Skill 来说,失败流程中能够被保存和复用的部分,同样属于产品资产。

3.2 第三次尝试,把插画、文字和标题拆开处理

第三次尝试没有要求模型一次完成插画、正文和标题,而是先生成不含文字的五张插画底图。这样可以先检查人物、猫咪、构图和信息区域是否合理,不必在角色尚未确定时同时处理中文字体和排版问题。

第三次尝试先生成的插画底图

图 5:第三次尝试先完成插画和页面结构,为后续文字排版预留空间。

随后,正文与信息结构由 AI 直接生成并排版。模型能够把标题、对话、流程节点和底部解释放入页面,但结果仍然出现了字体气质、字号层级、行距和安全边距不稳定的问题。尤其在手机宽度下,文字是否清晰、信息是否溢出,已经不再只是审美偏好,而是基本可用性问题。

AI加入正文与信息排版后的版本

图 6:AI 已经完成正文与信息排版,但标题、字体、字号和页面边距仍需要继续调整。

这一步让我意识到,插画生成与中文信息排版虽然都发生在同一张图里,却属于两类不同任务。插画允许一定变化,排版却更强调准确、对齐和可读;把它们一次性交给模型处理,一个文字问题就可能触发整页重绘。将两者拆开,至少能够让每一轮修改只围绕一种主要问题展开。

3.3 没有合适的字体,就把标题变成独立视觉资产

正文排版之后,标题仍然没有达到预期。问题不仅是字体名称,还包括笔画粗细、手写感、字号比例和关键词强调方式。如果环境中没有合适字体,继续要求模型在整张页面上反复尝试,很容易同时改变插画和正文。

第三次尝试最终把五张图的标题单独提取出来重新生成。模型不再从字体库中机械选择,而是直接绘制符合整体气质的标题文字,再把标题作为独立视觉元素放回页面。这样做并没有彻底消除随机性,却把问题缩小到了标题本身。

第三次尝试中重新生成的标题文字

图 7:标题被拆成独立视觉资产,集中处理字形、粗细和关键词强调。

最终版由插画底图、正文信息排版和独立标题组合完成。它并不是一次提示词直接生成的结果,而是多个阶段结果逐步确认后的集成。

第三次尝试最终版

图 8:第三次尝试最终形成的五张知识图解。

分阶段并不会让模型突然变得确定,但它改变了返工发生的位置。内容问题在出图前解决,角色与构图在插画阶段解决,文字问题在排版阶段解决,标题问题则被限制在独立资产中。少一次全局重绘,往往比加快一次生成更有价值。

四、把“好看”拆开,审美才有机会进入 Skill

4.1 “高级、简洁、有设计感”都不是可执行需求

在制作过程中,我逐渐意识到,“高级”“简洁”“有设计感”“像知识博主的图”都只是偏好,不是执行规则。模型不知道我说的简洁,是减少颜色、减少文字、增加留白,还是简化人物线条;也不知道“手绘感”指字体抖动、线条不规则,还是纸张纹理。

这类词对人有启发性,却没有明确的操作对象。只要没有把它们继续拆开,每次生成时,模型都会重新决定什么叫“简洁”、什么叫“活泼”,结果自然会在一个模糊范围内摆动。继续增加形容词只会让偏好显得更丰富,不会自动形成稳定标准。

要让审美进入 Skill,第一步不是寻找更准确的风格标签,而是把偏好翻译成可以执行的视觉变量。日系极简可以拆成背景、留白、装饰数量和颜色数量;手绘感可以拆成线条粗细、规则程度与字形;IP 统一可以拆成发型、服装、眼睛、项圈和身体比例。

4.2 审美不仅是插画风格,也是信息怎样被看见

最初讨论“审美”时,我关注的是女孩和猫咪画得像不像参考图。真正进入排版阶段后才发现,决定整套图片是否成立的,还有标题离页面顶部有多远、正文缩小后能否辨认、卡片之间是否对齐、强调色是否抢占主结论,以及一页到底塞进多少信息。

同样一张插画,标题层级混乱时,读者不知道先看哪里;同样一段文字,放进过窄的卡片后,字号只能不断缩小;同样是蓝黄配色,如果每一个图标都使用高饱和颜色,页面就没有真正的视觉重点。审美因此不仅是“画成什么风格”,也是信息按照什么顺序被读者看见。

这也是为什么知识图解不能只设置插画提示词。视觉规范还要说明封面与内页的信息密度、标题和正文层级、安全边距、卡片结构、单页核心结论,以及颜色在不同语义中的职责。否则,角色看起来统一,整套内容仍然可能缺少系统感。

4.3 能被检查的偏好,才有机会成为 Skill 规则

“画面更舒服”无法进入检查清单,“四周边距一致、标题不贴顶、手机端正文可读、角色识别特征保持一致”可以。把审美写进 Skill 的最后一步,是给视觉变量补上可以判断的结果。

把好看拆成可执行规则的信息图

图 9:将模糊审美偏好拆成视觉变量和验收标准。只有能被检查的偏好,才有机会成为 Skill 规则。

这套拆解并不意味着审美已经被完全量化。留白是否舒服、角色是否有亲和力、页面是否“刚刚好”,仍然需要人的整体判断。但把能够明确的部分先写清,可以把人的注意力从重复检查字号、边距和角色细节,转移到真正需要经验的取舍上。

审美规则的价值也不在于限制所有变化。角色的发型、服装和眼睛属于身份不变量,动作、表情和手持道具则应该根据页面任务变化;蓝黄是主要强调色,但具体使用面积仍要服从内容层级。可复用的视觉系统不是把每张图做成复制品,而是在稳定识别与必要变化之间建立边界。

五、真正进入 Skill 的,不是一段更长的提示词

5.1 提示词写得足够长,也不等于工作流足够稳定

把审美拆成视觉变量之后,最直接的做法似乎是把这些要求全部塞进提示词:女孩长什么样、猫咪有哪些特征、页面使用什么颜色、标题放在哪里、正文用多大字号、参考图分别参考什么、最终输出几张图片……要求写得越多,看起来越接近一份完整规范。

第三次尝试时,我确实已经列出了十多项要求。问题却不在信息不够多,而在不同层级的任务被混在了一起。模型既要判断选题,又要拆解内容;既要设计角色和插画,又要完成中文排版;生成之后,还要自己判断角色是否一致、文字是否清晰、页面是否符合参考风格。只要其中一个环节发生偏差,后续步骤就会继续建立在错误结果上。

这也是长提示词很容易制造的一种错觉:我们把所有要求都写进去了,就以为流程已经被控制住了。但提示词主要解决的是“这一次应该怎样执行”,它不能自动保存哪一版角色已经确认,也不能决定什么时候必须暂停,更无法替代样页确认、版本回退和失败处理。

真正需要回答的问题不是“提示词还能再加什么”,而是哪些规则长期有效,哪些内容只属于本次任务,哪些结果需要保存为资产,模型执行到哪一步必须停下来等待确认。

5.2 规则、资产、脚本和状态,分别解决不同问题

OpenAI 当前对 Skill 的说明中,Skill 并不只是一个写得更复杂的 SKILL.md,而是一个可以同时包含指令、参考资料、脚本和资源文件的能力包;Agent Skills 的开放规范也采用了类似结构:SKILL.md 负责核心说明,references 保存详细资料,scripts 承担可以稳定执行的操作,assets 保存模板、图片和其他静态资源。1,2

放到这次知识图解实验里,这几类内容承担的职责并不相同。规则负责保存已经形成的判断,例如目标读者是谁、怎样选择知识切入点、封面和内页分别承担什么任务、视觉变量有哪些、什么情况下可以进入批量生成。它解决的是“以后遇到相似任务,应该按照什么原则作出决定”。

资产负责保存不能每次重新描述的视觉基准。第二次尝试中达到预期的女孩和猫咪形象、第三次确认的角色参考、独立生成的标题文字、已经通过的样页,都应该被当成可以重复引用的资产,而不是下一次再用一段文字重新猜一遍。它解决的是“哪些结果已经确认,不需要模型再次解释”。

脚本或稳定工具适合处理那些不应该继续依赖随机生成的环节,例如图片尺寸统一、文件命名、页面拼接、导出检查,以及后续可能采用的中文文字排版。第三次尝试中的正文与信息排版仍由 AI 直接生成,因此字体、字号和标题效果需要反复调整。这个结果并不意味着 AI 不能排字,而是说明当文字准确性和版式稳定性成为主要验收指标时,确定性工具通常比反复生成整张图片更适合承担最后一步。

状态则记录当前任务已经走到了哪里:本期选题是什么,哪版脚本已经确认,使用哪张角色基准图,当前样页版本是多少,本轮究竟要改哪一个问题。网络中断之所以会导致流程很难继续,并不只是连接出了问题,而是这些状态没有被完整保存下来。没有状态记录,重新连接之后只能依赖对话上下文猜测“上一版”和“刚才那张图”分别指什么。

因此,这个 Skill 真正需要保存的不是一条万能提示词,而是一套分工明确的材料:规则负责判断,资产负责保持一致,脚本负责执行稳定动作,状态负责让流程能够接续。

5.3 提示词需要定义阶段、基准和停止条件

提示词仍然重要,只是它不应该独自承担整条工作流。经过三次尝试后,我更愿意把它写成一份分阶段的生产说明,而不是一次性出图指令:

# 任务目标
把输入的 AI 概念、文章或学习笔记,转成一组帮助初学者建立准确直觉的知识图解。

# 第一阶段:内容脚本
先判断核心误区、目标读者和主结论,再规划逐页脚本。
只输出标题、正文要点、视觉关系和角色动作,不生成图片。
输出后停止,等待确认。

# 第二阶段:角色与样页
读取已经确认的女孩、猫咪和视觉参考。
先核对角色不变量,再选择信息密度最高的一页生成样页。
检查字体、字号、边距、信息密度和手机端可读性。
样页未确认前,不批量生成其他页面。

# 第三阶段:批量生成与验收
基于已确认的脚本、角色基准和样页生成其余页面。
逐页检查概念准确性、文字、角色一致性、标题层级和安全边距。
发现无法确定的问题时停止,不自行修改已经确认的内容。

这份结构没有试图消除模型的不确定性,而是限制不确定性发生的范围:内容阶段不处理视觉问题,样页阶段不急着扩大生产,批量阶段不再重新讨论角色和版式。每一次确认都会生成下一阶段可以引用的基准,模型不必同时猜测所有问题的答案。

局部修改也需要同样的思路。“只修改猫咪,其他不变”看起来很明确,实际仍然缺少编辑基准和保留范围。OpenAI 的图像提示指南建议在编辑任务中同时列出“改变什么”和“必须保留什么”,连续修改时还要重复关键不变量,以降低非目标区域发生漂移的概率。3

因此,局部修改提示词至少需要写清四项内容:以哪一个版本为基准、本轮只改哪一处、哪些内容必须保持、无法完成局部修改时怎样处理。例如:

以 final-v10 为本轮唯一编辑基准。

本轮只修改:
猫咪项圈上的蓝色箭头,将箭头尖端改为朝下。

必须保持:
人物和猫咪的动作、表情、比例与位置;
全部标题、正文、图标和其他插画;
页面构图、留白、安全边距、背景与配色。

停止条件:
如果无法只修改目标元素,停止并说明原因;
不要重新生成整张图片,也不要在漂移版本上继续修改。

这里最重要的不是措辞变得更严厉,而是提示词终于拥有了基准、边界和失败出口。它不再要求模型“无论如何给出一张结果”,而是允许模型在条件不满足时停下来。对一次生图来说,停止可能意味着没有交付;对一条需要反复运行的产品工作流来说,及时停止往往比交付一张看似完整、实际已经偏离基准的图片更有价值。

六、从“能出图”到“可交付”:Skill 还需要一套产品指标

6.1 一次满意的结果,只能证明能力上限

第三次尝试最终生成的五张图片,已经达到了这次实验的基本预期:角色能够被识别为同一个女孩和同一只猫咪,页面之间保持了相近的手绘风格,文字、插画和信息结构也形成了完整的一组内容。但如果把它当成一个产品结果,这套图片最多只能证明,在持续人工参与、反复修改和明确参考的条件下,这条工作流有能力做到什么。

它还不能证明,下一次输入 RAG、MCP 或 Token 时,Skill 仍然能够用相近的时间、修改轮次和资源消耗,生成同样稳定的结果。生成式模型具有不确定性,同一套规则在不同主题、不同信息密度和不同参考材料下,可能暴露出完全不同的问题。信息少时,页面可能显得空;信息多时,正文容易缩小或溢出;生活化概念适合用角色场景表达,复杂架构则可能更依赖流程图和关系图。

因此,产品化测试不能只保留表现最好的一组图片。还需要准备几类具有差异的真实任务:定义类概念、流程类概念、对比类概念、包含长文本的复杂主题,以及参考资料不完整的边界案例。只有这些任务都能按照同一条主流程推进,Skill 才开始具有复用价值。一次成功出图证明的是能力上限,多次任务的平均表现,才决定这项能力是否真的可用。

6.2 验收需要区分硬门槛、质量评分和过程指标

“整体挺好看”很难支持下一轮迭代,因为它没有说明究竟好在哪里,也无法判断新版本是否比旧版本更稳定。OpenAI 的图像评测案例采用了一种更适合生产场景的方式:将指令遵循、文字准确性等关键问题设置为必须通过的硬门槛,再分别评价版式层级、风格匹配和视觉质量。这样可以避免一张文字错误的图片,仅仅因为插画漂亮就获得较高总分。4

对这套知识图解 Skill,我更倾向于把验收拆成三层。第一层是不能妥协的硬门槛,包括核心概念没有明显错误、标题和正文没有错字或缺失、手机端能够辨认、角色身份不变量保持一致、输出尺寸正确,以及没有生成未经要求的文字和装饰。任何一项不通过,这张图就不能进入最终交付,其他视觉优点也不能抵消。

第二层是可以分级判断的质量指标,例如信息层级是否清楚、画面是否符合手绘视觉规范、插画是否真正承担解释任务、页面之间的密度是否均衡,以及颜色使用有没有干扰阅读。这些指标很难完全自动判断,但可以通过明确的 1—5 分标准减少“凭感觉打分”的随意性。

第三层是工作流自身的过程指标,包括内容脚本一次通过率、角色基准确认轮次、样页通过率、平均修改次数、非目标区域漂移率、单套交付时长、图像调用次数,以及网络中断后能否从正确版本继续。OpenAI 关于 Skill 评测的实践也建议分别观察结果、执行过程、风格和效率,而不是用一个笼统的成功率覆盖所有问题。5

这些指标不需要一开始就全部自动化。最初可以只用一张简单的任务记录表,把每次生成的主题、版本、问题类型、修改轮次和最终结果保存下来。当样本增加以后,再判断哪些问题最频繁、哪些返工最昂贵,下一轮规则优化也就有了依据。

6.3 真正昂贵的不是生成,而是没有边界的返工

最终交付只有五张图片,但整个过程进行了三次尝试,产生了十多个版本,前后花费四个多小时。时间并不都消耗在模型生成上,还包括整理和上传参考图、等待结果、检查文字、对比角色、重新描述问题、确认新版本,以及连接中断后的状态恢复。

这意味着,评估这类 Skill 的成本时,不能只看单次生图消耗。更接近真实情况的计算方式是:

单套实际成本 = 模型调用成本 + 人工检查与修改时间 + 失败重试成本 + 状态恢复成本

其中最容易被忽略的是人工判断。模型可能只用了几十秒生成图片,但人需要逐页检查标题、正文、角色和边距;如果一次局部修改同时破坏了其他区域,还要重新寻找基准版本,再决定继续修改还是整体回退。修改次数越多,版本之间的关系越难判断,后面的每一次决策也会变慢。

因此,产品优化的重点不应该只是让模型“出图更快”,而是提高每个阶段的通过率。选题和脚本在出图前确认,可以减少内容返工;角色和样页在批量前确认,可以减少全套重做;局部修改引用明确基准,可以避免问题在错误版本上继续累积。少生成一次错误的整套图片,通常比把单张图片的生成时间缩短几十秒更有价值。

6.4 成熟的 Skill 不只知道怎样继续,也要知道何时停下来

如果 Skill 的目标只是完成任务,它很容易在信息不足时自行补全,在参考冲突时选择其中一种风格,在局部编辑失败后重新生成整张图片。最终也许仍然能得到一个完整结果,但完整不等于正确,更不等于可以交付。

这套工作流至少需要在几种情况下主动暂停:没有足够资料判断概念边界时,先请求补充来源;角色基准尚未确认时,不进入批量生成;样页的文字和密度没有通过时,不继续制作其他页面;网络中断后无法确认当前版本时,不根据模糊上下文猜测;局部修改无法保持非目标区域时,回到上一版,而不是在漂移结果上继续叠加修改。

还有一些任务本身就不适合完全交给生成流程。严格品牌规范要求固定字体、精确网格和像素级版式时,应该让稳定的设计或排版工具接管;页面包含大量中文长文本时,插画与文字最好分开处理;涉及医疗、法律、金融等高风险知识时,内容必须经过专业人员复核,不能因为已经生成成图,就把视觉完整误认为事实可靠。

从产品角度看,人工介入不是 Skill 失败的证明。恰恰相反,明确哪些判断可以自动执行、哪些结果必须确认、哪些问题应该交还给人,才是一条成熟工作流应有的边界。一个真正可用的 Skill,不是无论遇到什么情况都能继续生成,而是能够在正确的地方自动推进,也能够在错误成本扩大之前及时停下来。

结语:审美可以被写进 Skill,但不能被外包

做到第三次尝试时,我已经不再把问题理解为“怎样让模型更听话”。模型当然需要更明确的提示词,但真正决定结果的,是提示词之外那些原本没有被说清楚的选择:这组图究竟要帮助谁理解什么,五张图片怎样形成递进,哪些角色特征不能变化,文字和插画分别承担什么任务,哪一版结果已经确认,以及什么情况下应该停止生成。

这些选择一开始散落在对话、参考图和临时判断里,所以每次重新生成都像在重新回答同一批问题。把它们整理成规则、资产、状态、确认节点和验收标准之后,它们才真正开始进入 Skill。下一次更换知识主题时,可以重新讨论内容,却不必重新定义女孩和猫咪;可以调整每页场景,却不必重新决定字体层级和页面边距;可以接受生成结果存在变化,却不必再靠不断试图碰到一张“刚好顺眼”的图片。

但审美被结构化,并不意味着人的判断可以被取消。Skill 可以规定蓝色和黄色怎样使用,却不能独自判断某一处蓝色是否已经破坏了画面重心;可以要求封面保持低信息密度,却不能自动决定哪一句话最值得成为封面主结论;可以检查角色特征是否一致,却不能替作者判断一张图虽然符合规则,为什么仍然没有把知识讲明白。规则能够减少重复决策,却不能代替最终取舍。

这也是我认为这次实验最有价值的地方。AI 没有让人的工作消失,而是把人的工作向前推了。过去,时间主要花在画图、排版和修改;现在,更多时间被放在选题、拆解、规范、版本管理和验收上。执行成本可能下降了,但判断的重要性反而变得更明显。没有这些判断,生成速度越快,只会越快地产生更多需要返工的版本。

以后再制作 RAG、MCP 或 Token 等知识图解时,我仍然需要检查内容、调整画面,也不期待 Skill 一次生成最终成品。但至少,不必再从零开始解释什么叫“我想要的手绘感”,也不必在网络中断后重新猜测哪一张才是基准版本。那些已经付出过时间、犯过错误并得到确认的选择,应该被保留下来,成为下一次工作的起点。

审美当然可以被写进 Skill。只是写进去的并不是“审美”这个抽象词,而是我们为了接近某种审美,反复作出的选择、保留、放弃、边界和检查方法。至于最后那一下判断,仍然属于人。

开源说明

这套知识图解 Skill 已开源到 GitHub,感兴趣的朋友可以随时下载体验:Nontylee/xiaohongshu-knowledge-graphics

参考资料

[1] OpenAI:Build skills

[2] Agent Skills:Specification

[3] OpenAI:GPT Image Generation Models Prompting Guide

[4] OpenAI:Image Evals for Image Generation and Editing Use Cases

[5] OpenAI:Testing Agent Skills Systematically with Evals