教师做一组教学宣传材料时,常见的顺序是先找一张图,再临时写几句文案,觉得画面不错就尝试生成视频,最后把文件散落在下载目录里。下次遇到相似任务,又从提示词开始摸索。问题不在于不会用图片或视频模型,而在于几个工具之间没有共同的任务书、文件规则和验收标准。
真正值得复用的不是某一句“神提示词”,而是一条能够从需求走到交付的工作流:先确定受众与用途,整理事实和视觉方向,生成并筛选图片,用关键帧组织视频,再把成熟步骤写成 Skill。模型可以更换,流程的输入、输出和检查点仍然保持稳定。
图片、视频和 Skill 不是三个并列工具。图片提供视觉事实,视频把这些事实放进时间线,Skill 则把已经验证过的做法保存下来。
先定义交付包,不要先打开生成工具
从交付物倒推,工作会清楚很多。一次校园科技节宣传,可能需要一张横版头图、三张正文配图、一段十五秒横版视频,以及封面、字幕和发布说明;一节课堂导入则可能只需要一张场景图和一段无声循环动画。尺寸、数量、时长、画面比例和使用位置不同,生成策略也会完全不同。
先列交付清单,再判断哪些要生成、哪些能使用实拍、哪些只需要排版。能从真实活动照片中获得的信息,不必让模型重新想象;需要保护学生隐私时,可以使用示意场景或经过授权的素材。每项交付物都指定文件名、格式和负责人,例如封面、正文图、首帧、末帧、字幕稿、成片和来源记录分开保存。
还要明确“最终确认的人”。AI 可以生成候选、整理素材、检查尺寸,却不能替学校确认事实、肖像授权和公开发布。交付包里应当包含一份待确认清单,而不是只有几个看起来已经完成的文件。
一份视觉任务书,作为全流程的事实来源
图片和视频最容易失控的地方,是每一轮提示词都悄悄改变设定。第一张图是晴天,第二张变成夜晚;人物服装、校园建筑、主色和道具不断漂移。解决办法不是反复补一句“保持一致”,而是先写一份短小的视觉任务书,让后续所有工具都从同一份事实出发。
任务书至少包含七项:面向谁;传达什么;必须出现的场景或物件;人物和环境设定;色彩与画面风格;尺寸和留白位置;禁止出现的内容。涉及真实活动时,再附上学校名称、日期、流程等已经核对的文字事实,但不要要求图片模型直接生成大段中文文字,标题和说明更适合在后期排版。

参考图也要说明“参考什么”。可以只参考色彩、构图、光线或材质,不要笼统地要求照着某位在世艺术家的个人风格复制。若使用第三方图片和视频模型,提前确认素材上传、输出版权、保存期限和学校数据政策,不把学生照片、校内账号截图或未公开材料随手上传。
封面、正文图和关键帧要分开生成
一张好看的图不一定适合所有位置。网站封面需要横向构图,并为标题留出低细节区域;正文图更需要解释一个关系或步骤;视频关键帧则要考虑人物下一秒能否自然移动、镜头是否有连续空间。把三者混成一个提示,会得到“哪里都能用一点,但哪里都不够合适”的结果。
生成封面时先锁定比例、主体位置和标题安全区;正文图先确定要解释的概念,例如流程、对比、角色关系或检查点;关键帧再固定人物外观、镜头方向、环境和动作起点。OpenAI 的图片生成指南区分了生成与编辑,并支持使用图像作为输入。实际工作中,可以先选中一张构图可靠的基准图,再用编辑保持主体和色彩,而不是每次从纯文字重新抽取随机结果。
每轮只改变一两个变量也很重要。先比较构图,再比较光线,最后修正细节;如果人物、场景、色彩和镜头一起换,教师很难说清哪一项让结果变好。保留被采用的提示、参考图和参数,未采用候选可以低分辨率归档或及时清理。
从静态图片到视频,先过分镜这一关
把一张图直接交给视频模型并要求“动起来”,通常只能得到一个能播放的片段,未必能讲清楚内容。先用四到六格分镜拆开时间:开场看见什么;人物做什么;镜头如何移动;哪一秒出现转折;最后停在哪里。每一格只写一个主要动作,短视频尤其不要塞进过多信息。
首帧和末帧是两个最有价值的控制点。首帧确定人物、场景与构图,末帧确定动作的目标和画面落点。中间再说明镜头速度、环境变化和不能发生的变形。OpenAI 的视频生成指南提供了从文字或图像生成视频的路径;无论使用哪家模型,用已经确认的图片作为视觉输入,通常都比每个镜头单独用文字起步更容易保持连续。

字幕、校徽、活动名称和日期不要强行烘焙进生成画面。保留安全区,成片后再用剪辑或排版工具叠加,文字才可修改、可校对,也更适应横版、竖版和不同平台。视频先生成无文字的干净母版,字幕稿和画面时间点单独保存。
模型可以更换,输入输出接口不要跟着变
学校可能在本地模型、云端 API 和不同第三方服务之间切换。有的模型擅长写实人物,有的更适合信息图,有的能参考多张图片,有的只接受一张首帧。工作流不应把所有规则写死在某个产品按钮里,而应先定义统一输入:任务书、参考图、尺寸、数量、输出目录和禁用元素;再定义统一输出:原图、缩略图、提示记录、来源与授权说明。
当模型变化时,只替换“适配层”。例如把统一任务书转换为该模型需要的提示格式,把输出文件重命名并放进同一目录,再执行相同的尺寸、文字、人物一致性和内容安全检查。教师不需要记住每家产品的全部功能,只需知道当前节点为什么选择它,以及失败时回到哪一步。
验收要同时看内容、画面和文件
图片验收不只是“好不好看”。先检查事实:人物数量、场景、器材和校内标识是否符合任务书;再检查画面:手指、文字、边缘、光影和透视是否异常;最后检查文件:比例、像素、格式、颜色和大小是否满足发布位置。封面还要把实际标题叠上去看一次,确认明暗主题下都能读清楚。
视频增加时间维度后,要逐镜头看人物是否跳变、物体是否凭空出现、运动方向是否连续、首尾是否适合剪接。音频存在时检查人声、音乐和环境声的授权与音量;面向学生播放的内容,还要检查节奏、闪烁和可能造成误解的画面。最终导出后重新打开文件,不以剪辑软件预览正常代替成片验收。
文件层面保留一份清单:文件名、用途、尺寸、时长、来源、生成日期、使用模型、是否包含个人信息、授权状态和最终版本。公开视频和图片应能追溯到任务书和确认人,避免半年后只剩一堆无法判断来源的文件。
流程稳定以后,再把它写成 Skill
Skill 不是一段很长的万能提示,而是任务专用的工作说明和配套资源。OpenAI 的Skill 构建文档说明,Skill 由一个包含 SKILL.md 的目录组成,还可以带脚本和参考资料;名称与描述负责让系统判断什么时候使用它,完整说明在匹配任务后才加载。
封装前至少真实完成两到三次任务。把每次都会执行的步骤写进主说明,把尺寸表、提示模板、验收表放进参考文件,把重命名、压缩、抽帧和尺寸检查这类机械步骤做成脚本。把例外也写进去:没有参考图怎么办;图片出现文字怎么办;视频人物变形时回到哪一步;公开发布前必须由谁确认。

描述要具体到能正确触发,也要写清不适用范围。例如“为校园文章或教学宣传完成任务书、配图、分镜、视频母版和验收包;不负责未经授权的公开发布”。如果一句描述什么都能覆盖,系统反而难以判断什么时候该用。完成后用一个全新任务测试,让 Skill 从空目录开始生成交付包,再检查它是否真的按说明停在人工确认点。
先跑通一个小闭环,再扩成内容生产线
第一次可以只做一篇文章:一张横版封面、两张正文图、一段由其中一张图延伸出的五秒视频,以及一份验收清单。全过程控制在一个主题、一个人物或一种视觉语言里。教师亲自完成事实确认、候选选择和最终发布,其余机械步骤交给工具。
第二次复用同一任务书模板和目录结构,记录哪些地方仍需临时解释。第三次再把稳定部分写进 Skill,并把模型选择做成可配置项。这样得到的不是一条脆弱的“一键生成”链,而是一条能看见输入、能检查中间结果、能在错误处回退的生产线。
当流程清楚以后,图片不再是临时装饰,视频也不再是一次性的演示。它们共同服务于一份已经核对的内容;Skill 则让下一次制作从已有经验继续,而不是从空白提示框重新开始。
图片、视频和 Skill 怎样串成一条工作流
本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。
评论交流
欢迎留下你的想法