零代码AI生图生视频实操笔记
AI 生图与生视频的零代码实操笔记:提示词拆解、参考图用法与参数选择
摘要:市面上大部分 AI 生图教程默认你会写代码——装环境、申请 Key、写请求。其实对绝大多数个人创作者来说,这些步骤可以直接跳过。本文记录一套零代码的实操方法:提示词怎么拆、参考图怎么用、参数怎么选、出片不满意怎么迭代。
一、先明确能力边界:不写代码能做到什么程度
先说结论:不写代码不等于只能做出低质量的东西,区别只在于"谁来负责调用"。
零代码方案能覆盖的:
- 单张/批量出图,海报、封面、信息图、插画都能出
- 用参考图做风格迁移、内容替换
- 图生视频、文生视频、带参考视频/音频的生成
- 结果直接下载,或继续在同一个工作区里二次加工
什么情况下还是得写代码:
| 你的需求 | 建议路线 |
|---|---|
| 给个人号做封面、做素材 | 零代码足够 |
| 一次性出十几二十张图 | 零代码足够 |
| 每天固定批量生成几百张 | 写代码(要自动化调度) |
| 把生成能力集成进自己的产品 | 写代码(走 API) |
| 需要对结果做程序化后处理 | 写代码 |
另外一个容易忽略的点是交互形态。很多工具是"对话式"的,你发一句提示词,它回一张图,对话往上翻就找不到了。而"画布式/工作台式"的工具会把每次生成的结果留在画布上,可以随时拖出来当下一轮的参考图。后者更适合连续创作——这一点比"是否易用"更影响最终效果。
二、提示词:拆成五个要素,比背模板有用
很多人卡在"不知道怎么写提示词",于是到处收集模板。但模板换个主题就失效,真正有用的是结构。
把一句提示词拆成五个部分:
| 要素 | 作用 | 示例 |
|---|---|---|
| 主体 | 画什么 | 一瓶磨砂玻璃质感的护肤精华 |
| 风格 | 像谁画的 | 极简商业摄影风,质感接近某杂志广告 |
| 构图与镜头 | 怎么摆、怎么拍 | 居中构图,微距镜头,浅景深 |
| 光线与色调 | 氛围 | 侧逆光,暖调柔光,背景米白 |
| 用途与画幅 | 给谁用 | 电商主图,1:1 正方形 |
改写前后对比(同一个需求):
改写前:
帮我画一张高级感的护肤品图片
改写后:
一瓶磨砂玻璃质感的护肤精华,极简商业摄影风格,居中构图,微距镜头、浅景深,侧逆光加暖调柔光,背景米白色,用于电商主图,1:1 画幅
差距在于:前者把"高级感"这种抽象形容交给模型猜,后者把可执行的视觉信息全给全了。
几条通用经验:
- 具体名词优于抽象形容词。"磨砂玻璃瓶"远比"高级质感"有效。
- 画面里的文字要加引号,比如让它写标题就写成
写上"新品上市"字样,否则容易糊成乱码。 - 一次只改一个变量。构图不对就改构图,别同时把风格也换了,否则你不知道是哪句起了作用。
- 中文可以直接用,但风格类专有词(如 Octane Render、Bento Grid、Isometric)保留英文,效果通常更稳。
- 别一次塞十个要求。要素超过五六个,模型会开始丢掉其中一部分。
三、参考图:效率最高的一招
写提示词描述风格是很费劲的,而直接给一张参考图,胜过一千字的形容词。

一个典型的画布式工作台:参数全部点选,唯一需要输入的是提示词
从上图能看到,参考图有两条引入路径:
- 上传:从本地选图
- 剪切板:截图后直接粘贴(
Ctrl+V),不用先存成文件
用参考图时,把两类需求分清楚,出错的概率会低很多:
- 风格迁移:"参考这张图的配色和质感,但内容换成 XXX"——保留的是视觉语言
- 内容替换:"保持这个人物的形象,换一个姿势/场景"——保留的是主体特征
两个容易踩的坑:
- 参考图不是越多越好。多张风格冲突的图会让模型互相打架,一张主参考 + 文字补充细节,通常比堆五张图效果更好。
- 要明确说"参考什么"。只说"参考这张图",模型可能连构图一起抄了;写成"参考这张图的配色与光影,构图不变"会更可控。
四、参数:分辨率和宽高比怎么选
参数不多,但选错会白白浪费时间。
宽高比对照表(可直接收藏):
| 比例 | 典型用途 |
|---|---|
| 1:1 | 头像、电商主图、社交平台方图 |
| 3:2 / 4:3 | 横版海报、横屏展示、演示配图 |
| 2:3 / 3:4 | 竖版海报、书籍封面、手机端详情页 |
| 16:9 | 视频封面、PPT、电脑壁纸 |
| 9:16 | 短视频封面、手机壁纸、竖屏物料 |
分辨率策略:低档试错,高档出稿。
这是个很实用的习惯:构图、风格没定下来之前,用低分辨率快速试几个版本,确认方向后再用高分辨率重出一遍。直接上最高档,每一次试错都要等更久。
五、生视频:把静态画面"动"起来
视频的门槛看起来比图片高,但提示词的写法其实是同一套逻辑,只是要素换了。
视频提示词的四个要素:
| 要素 | 说明 | 示例 |
|---|---|---|
| 镜头运动 | 相机怎么走 | 镜头缓慢推进,轻微手持晃动 |
| 主体动作 | 画面里的东西在做什么 | 产品缓慢旋转,水面泛起波纹 |
| 场景氛围 | 环境与光 | 傍晚暖光,桌面布景 |
| 画面风格 | 整体质感 | 商业广告片,浅景深 |

视频创作台:相比生图多出参考视频、参考音频两个入口,操作逻辑完全一致
视频这边多了三类可选的参考素材:
- 参考图:可以作为首帧,也能一次给多张做内容参考
- 参考视频:让模型学习运镜和节奏,适合复刻某种镜头语言
- 参考音频:配合音频做画面节奏
清晰度怎么选:和图片一个思路,480p 用来快速验证运镜和构图,方向对了再出 720p 或 1080p。
视频更容易翻车的三个地方:
- 镜头描述太多。写了推镜又写环绕又写拉远,模型会来回摇摆,画面变得混乱。一次只描述一种主要运动。
- 主体动作过快过复杂。快速奔跑、剧烈打斗这类内容,目前最容易糊。慢速、连续的动作稳定性高得多。
- 时长越长越容易崩。如果要长片,更稳的做法是分成几个短片段,再拼起来。
六、一次生成不满意,怎么迭代
新手最容易犯的错是"不满意就把提示词全删了重写",这样每一轮都是重新抽奖。更有效的做法:
- 保留有效部分,只改一处。上一版只有光线不对,那就只改光线那一句。
- 让结果滚雪球。把上一轮里满意的部分截图,作为下一轮的参考图传进去,在它的基础上继续改。
- 积累自己的参数库。每次调出一组满意结果,把提示词原样存下来。用久了,你会有一套只属于自己的"配方"。
- 接受失败。AI 生成在文字排版、精确手部动作、特定品牌标识上依然不稳定。这些地方该用传统设计工具就用传统工具,别硬刚。
七、几类常见需求的提示词思路
最后把几个高频场景的思路整理成表,可直接套用:
| 需求 | 提示词思路 |
|---|---|
| 产品海报 | 参照某张图的配色与排版风格 + 主体产品描述 + "写上"标题文字"" |
| 知识信息图 | 先让它调研/梳理内容,再要求用手绘卡通风格、1-6 词短句、大量留白呈现 |
| 角色表情包 | 指定 Q 版比例、布局网格(如 4x6)、每格的聊天语句,注明"手写简体中文" |
| PPT 页面 | 指定画幅 16:9 + 布局系统(如 Bento 网格)+ 质感(玻璃拟态)+ 配色方案 |
| 文章转思维导图 | 主旨居中、分支节点、颜色编码、加简单图标、有机布局 |
| 手写解题 | 明确"手写图文并茂解答" + 分步骤 |
| 食材菜谱 | 上传食材照片 + 要求分步食谱 + 信息图形式呈现 |
这些思路的共同点是:把"我要什么"翻译成"画面里有什么"。这是零代码用 AI 创作唯一需要练习的技能。
八、小结
零代码方案的核心优势不是"便宜"或"简单",而是它把注意力还给了创作本身。你不用再关心鉴权、重试、结果解析,只管一轮一轮地把脑子里的画面调出来。
我用的是 Easy88AI 的无限画布,选它的原因是生图和生视频在同一个工作台里,模型、分辨率、宽高比全是点选,不用自己配任何接口,出图后能直接当下一轮的参考素材,迭代流程比较顺。类似形态的工具都可以套用本文的这套方法,方法本身是通用的。
如果这篇文章对你有帮助,欢迎点赞收藏。有具体的提示词问题,也可以在评论区贴出来一起看。
更多推荐



所有评论(0)