教师做一组教学宣传材料时,常见的顺序是先找一张图,再临时写几句文案,觉得画面不错就尝试生成视频,最后把文件散落在下载目录里。下次遇到相似任务,又从提示词开始摸索。问题不在于不会用图片或视频模型,而在于几个工具之间没有共同的任务书、文件规则和验收标准。

真正值得复用的不是某一句“神提示词”,而是一条能够从需求走到交付的工作流:先确定受众与用途,整理事实和视觉方向,生成并筛选图片,用关键帧组织视频,再把成熟步骤写成 Skill。模型可以更换,流程的输入、输出和检查点仍然保持稳定。

图片、视频和 Skill 不是三个并列工具。图片提供视觉事实,视频把这些事实放进时间线,Skill 则把已经验证过的做法保存下来。

先定义交付包,不要先打开生成工具

从交付物倒推,工作会清楚很多。一次校园科技节宣传,可能需要一张横版头图、三张正文配图、一段十五秒横版视频,以及封面、字幕和发布说明;一节课堂导入则可能只需要一张场景图和一段无声循环动画。尺寸、数量、时长、画面比例和使用位置不同,生成策略也会完全不同。

先列交付清单,再判断哪些要生成、哪些能使用实拍、哪些只需要排版。能从真实活动照片中获得的信息,不必让模型重新想象;需要保护学生隐私时,可以使用示意场景或经过授权的素材。每项交付物都指定文件名、格式和负责人,例如封面、正文图、首帧、末帧、字幕稿、成片和来源记录分开保存。

还要明确“最终确认的人”。AI 可以生成候选、整理素材、检查尺寸,却不能替学校确认事实、肖像授权和公开发布。交付包里应当包含一份待确认清单,而不是只有几个看起来已经完成的文件。

一份视觉任务书,作为全流程的事实来源

图片和视频最容易失控的地方,是每一轮提示词都悄悄改变设定。第一张图是晴天,第二张变成夜晚;人物服装、校园建筑、主色和道具不断漂移。解决办法不是反复补一句“保持一致”,而是先写一份短小的视觉任务书,让后续所有工具都从同一份事实出发。

任务书至少包含七项:面向谁;传达什么;必须出现的场景或物件;人物和环境设定;色彩与画面风格;尺寸和留白位置;禁止出现的内容。涉及真实活动时,再附上学校名称、日期、流程等已经核对的文字事实,但不要要求图片模型直接生成大段中文文字,标题和说明更适合在后期排版。

从视觉任务书、参考图和色板生成多张候选图片的流程示意
任务书负责固定场景、人物、构图、色彩和禁用元素;候选图只在允许变化的部分探索。

参考图也要说明“参考什么”。可以只参考色彩、构图、光线或材质,不要笼统地要求照着某位在世艺术家的个人风格复制。若使用第三方图片和视频模型,提前确认素材上传、输出版权、保存期限和学校数据政策,不把学生照片、校内账号截图或未公开材料随手上传。

封面、正文图和关键帧要分开生成

一张好看的图不一定适合所有位置。网站封面需要横向构图,并为标题留出低细节区域;正文图更需要解释一个关系或步骤;视频关键帧则要考虑人物下一秒能否自然移动、镜头是否有连续空间。把三者混成一个提示,会得到“哪里都能用一点,但哪里都不够合适”的结果。

生成封面时先锁定比例、主体位置和标题安全区;正文图先确定要解释的概念,例如流程、对比、角色关系或检查点;关键帧再固定人物外观、镜头方向、环境和动作起点。OpenAI 的图片生成指南区分了生成与编辑,并支持使用图像作为输入。实际工作中,可以先选中一张构图可靠的基准图,再用编辑保持主体和色彩,而不是每次从纯文字重新抽取随机结果。

每轮只改变一两个变量也很重要。先比较构图,再比较光线,最后修正细节;如果人物、场景、色彩和镜头一起换,教师很难说清哪一项让结果变好。保留被采用的提示、参考图和参数,未采用候选可以低分辨率归档或及时清理。

从静态图片到视频,先过分镜这一关

把一张图直接交给视频模型并要求“动起来”,通常只能得到一个能播放的片段,未必能讲清楚内容。先用四到六格分镜拆开时间:开场看见什么;人物做什么;镜头如何移动;哪一秒出现转折;最后停在哪里。每一格只写一个主要动作,短视频尤其不要塞进过多信息。

首帧和末帧是两个最有价值的控制点。首帧确定人物、场景与构图,末帧确定动作的目标和画面落点。中间再说明镜头速度、环境变化和不能发生的变形。OpenAI 的视频生成指南提供了从文字或图像生成视频的路径;无论使用哪家模型,用已经确认的图片作为视觉输入,通常都比每个镜头单独用文字起步更容易保持连续。

角色设定、六格分镜、首尾关键帧和短视频时间线的工作台
分镜先决定时间里的信息顺序,首尾关键帧再约束人物、机位和动作落点,视频生成只是落实这些决定。

字幕、校徽、活动名称和日期不要强行烘焙进生成画面。保留安全区,成片后再用剪辑或排版工具叠加,文字才可修改、可校对,也更适应横版、竖版和不同平台。视频先生成无文字的干净母版,字幕稿和画面时间点单独保存。

模型可以更换,输入输出接口不要跟着变

学校可能在本地模型、云端 API 和不同第三方服务之间切换。有的模型擅长写实人物,有的更适合信息图,有的能参考多张图片,有的只接受一张首帧。工作流不应把所有规则写死在某个产品按钮里,而应先定义统一输入:任务书、参考图、尺寸、数量、输出目录和禁用元素;再定义统一输出:原图、缩略图、提示记录、来源与授权说明。

当模型变化时,只替换“适配层”。例如把统一任务书转换为该模型需要的提示格式,把输出文件重命名并放进同一目录,再执行相同的尺寸、文字、人物一致性和内容安全检查。教师不需要记住每家产品的全部功能,只需知道当前节点为什么选择它,以及失败时回到哪一步。

工作节点

稳定输入

交付输出

验收重点

失败后回退

视觉任务书

用途、受众、事实、限制

任务书与参考素材

事实完整、禁用项明确

回到需求确认

图片生成

任务书、比例、参考图

封面、正文图、关键帧

构图、留白、人物与文字

只修改一个变量重试

视频生成

分镜、首尾帧、动作说明

无字幕母版片段

连续性、变形、节奏

缩短镜头或重做关键帧

后期包装

母版、字幕稿、标识素材

横版、竖版与封面

文字准确、授权、音量

回到可编辑工程

Skill 封装

已验证流程和检查清单

说明、模板、脚本、示例

触发范围、异常和复现

回到真实任务再验证

验收要同时看内容、画面和文件

图片验收不只是“好不好看”。先检查事实:人物数量、场景、器材和校内标识是否符合任务书;再检查画面:手指、文字、边缘、光影和透视是否异常;最后检查文件:比例、像素、格式、颜色和大小是否满足发布位置。封面还要把实际标题叠上去看一次,确认明暗主题下都能读清楚。

视频增加时间维度后,要逐镜头看人物是否跳变、物体是否凭空出现、运动方向是否连续、首尾是否适合剪接。音频存在时检查人声、音乐和环境声的授权与音量;面向学生播放的内容,还要检查节奏、闪烁和可能造成误解的画面。最终导出后重新打开文件,不以剪辑软件预览正常代替成片验收。

文件层面保留一份清单:文件名、用途、尺寸、时长、来源、生成日期、使用模型、是否包含个人信息、授权状态和最终版本。公开视频和图片应能追溯到任务书和确认人,避免半年后只剩一堆无法判断来源的文件。

流程稳定以后,再把它写成 Skill

Skill 不是一段很长的万能提示,而是任务专用的工作说明和配套资源。OpenAI 的Skill 构建文档说明,Skill 由一个包含 SKILL.md 的目录组成,还可以带脚本和参考资料;名称与描述负责让系统判断什么时候使用它,完整说明在匹配任务后才加载。

封装前至少真实完成两到三次任务。把每次都会执行的步骤写进主说明,把尺寸表、提示模板、验收表放进参考文件,把重命名、压缩、抽帧和尺寸检查这类机械步骤做成脚本。把例外也写进去:没有参考图怎么办;图片出现文字怎么办;视频人物变形时回到哪一步;公开发布前必须由谁确认。

包含流程说明、参考图、模板、脚本和验收清单的模块化 Skill 工具箱
Skill 保存的是经过验证的步骤、资源和检查方式。模型可替换,任务边界和验收标准应保持清楚。

描述要具体到能正确触发,也要写清不适用范围。例如“为校园文章或教学宣传完成任务书、配图、分镜、视频母版和验收包;不负责未经授权的公开发布”。如果一句描述什么都能覆盖,系统反而难以判断什么时候该用。完成后用一个全新任务测试,让 Skill 从空目录开始生成交付包,再检查它是否真的按说明停在人工确认点。

先跑通一个小闭环,再扩成内容生产线

第一次可以只做一篇文章:一张横版封面、两张正文图、一段由其中一张图延伸出的五秒视频,以及一份验收清单。全过程控制在一个主题、一个人物或一种视觉语言里。教师亲自完成事实确认、候选选择和最终发布,其余机械步骤交给工具。

第二次复用同一任务书模板和目录结构,记录哪些地方仍需临时解释。第三次再把稳定部分写进 Skill,并把模型选择做成可配置项。这样得到的不是一条脆弱的“一键生成”链,而是一条能看见输入、能检查中间结果、能在错误处回退的生产线。

当流程清楚以后,图片不再是临时装饰,视频也不再是一次性的演示。它们共同服务于一份已经核对的内容;Skill 则让下一次制作从已有经验继续,而不是从空白提示框重新开始。