视频剪辑师·AI视频· 课程页
让AI写脚本、出素材、剪片子——把"做视频"从请人花大钱的难事,变成一个人用手机就能跑通的日常,视频号/抖音日更不请人。
讲解:做一条视频就像做一道菜:先有菜谱(写脚本)、再备菜(找素材)、下锅炒(剪辑)、加调料(字幕和配音)、端上桌(发布)。新手最容易犯的错,是跳过脚本直接让AI生成全片——AI出什么就发什么,画面和逻辑都不可控,翻车率极高。正确做法是先走通这五步,再一步步让AI提速。剪映这类工具把五个环节做进一个App,AI在每一步都能搭把手:脚本让AI出初稿、素材让AI生成或找现成的、剪辑用剪映AI、字幕自动识别后人工改、发布前做检查。
为什么重要:先有流程再动手,新手才不会被"AI什么都能干"冲昏头。搞清每一步要什么,才知道该用哪个工具、怎么和AI分工——五步里每一步都有人该把关的地方,这才是"用AI"而不是"被AI用"。
讲解:做视频不一定要会拍大片,普通人上手最快的是两种:口播(对着镜头说话)和录屏(把手机或电脑屏幕录下来)。口播适合自我介绍、产品讲解、探店分享;录屏适合教操作、展示后台数据、演示小程序。动手前先想清楚三个问题——这条视频给谁看(客人?同行?家人?)、发在哪(抖音?快手?视频号?朋友圈?)、想达到什么目的(引流到店?卖货?涨粉?记录生活?)。
为什么重要:目的决定形式——同一条素材,发抖音和发视频号、做广告和做记录,时长、比例、语气完全不同;想清楚再动手,才不白忙。口播+录屏不需要摄影棚、演员和剧本,一部手机就能跑通全流程,是最低成本的起步方式。
讲解:手机竖着刷是主流习惯,抖音、快手、视频号以竖屏(9:16)为主——"9:16"指画面宽高比是9比16,竖屏视频的常用分辨率是1080×1920。横屏(16:9)适合B站、西瓜视频这类横着看的平台。发错比例,画面又小又有黑边,第一眼就劝退观众。剪映里新建项目时就能设置比例:9:16选"抖音/竖屏",16:9选"横屏",开剪前设好,比事后补救省事一百倍。字幕安全区指的是画面上下留出的安全空间,字幕别贴到屏幕边缘,防止被手机状态栏、平台UI挡住。
为什么重要:"竖屏横屏不分"是新手最常见的低级错误。比例对了,字幕、封面、画面构图才能一次到位;比例错了,画面再好看也白搭。剪映官网和抖音创作者中心都支持9:16/16:9设置与封面标题单独调整,这是发布前的第一道检查。
📌 本章小结
- 做视频五步走:脚本→素材→剪辑→字幕→发布,先搭流水线再动手,AI在每一步搭手
- 普通人从"口播+录屏"上手最快,动手前先回答"给谁看、在哪发、要干嘛"
- 竖屏9:16(1080×1920)是抖音/快手/视频号的基本盘,开剪前先设比例、留出字幕安全区
✍️ 自测题
- 一条视频的五个环节是什么?(答案提示:脚本→素材→剪辑→字幕→发布)
- 为什么说"一上来就让AI生成全片"容易翻车?(答案提示:没有脚本=没有方向,AI生成的画面和逻辑都不可控;AI只负责快,方向和把关必须自己做)
- 发抖音的视频应该用横屏还是竖屏?(答案提示:竖屏9:16、分辨率1080×1920;横屏16:9适合B站、西瓜视频)
讲解:分镜脚本就是"拍摄前的说明书",把一条视频拆成一格一格的镜头,写清楚每个镜头拍什么画面、说什么话(口播/台词)、拍多久,一条视频可以拆成几格到几十格。就像盖房子先有施工图,做视频先有分镜,后面每一步都有"图纸"可依。零基础学员不用从零写——把"我是谁、卖什么、给谁看"告诉AI,让它先出一版分镜,再按自家情况改。
为什么重要:没有分镜,拍着拍着就乱、素材多到剪不动;有了分镜,实拍照着拍、AI素材照着生成、剪辑照着拼,全流程都顺。剪映专业版升级的"AI文字成片"能力,依托成片助手已经能"一句话生成脚本、分镜并智能配音"。
讲解:口播稿是写给人听的话,不是写给眼睛看的文章。它要"说人话":短句、口语、有钩子——开头3秒抛问题、悬念或利益点抓住人,结尾留互动(点赞、评论、到店)。写文章可以绕弯,口播稿必须一听就懂:把"赋能、矩阵、闭环"这类词全换成"省事、划算、好用",把长句拆成短句,自己读一遍顺不顺口,观众才听得下去。
为什么重要:口播视频的命门在文案。文案口语化,AI配音和数字人才"像人",观众才愿意看完;文案像论文,AI配音一口气念长句,满屏"AI味",观众秒划走。把口播稿写好,是整条视频的地基。
讲解:AI写脚本的正确姿势是"批量出、人挑选":把"我是谁、卖什么、给谁看、想达到什么目的"告诉AI,让它一次出3版不同风格的口播稿——比如一版热情、一版实在、一版讲故事,然后人挑一版最像自家风格的,改改就能用。想要更准,就把"给谁看、在哪发、要干嘛"的答案一并喂给AI,它才知道往哪个方向写。
为什么重要:AI写初稿、人做决定,是AI做内容的第一原则。脚本是视频的地基,AI帮你快,但方向、事实和"是不是我家的风格"必须自己把关。三版起步,既给自己挑选的余地,也逼AI多角度想,避免"第一版就是错的"。
📌 本章小结
- 分镜脚本是"施工图":画面+台词+时长,一格一格写清楚,AI也能帮着出
- 口播稿说人话:短句、口语、开头3秒钩子、结尾留互动,写给人听不是写给眼睛看
- AI批量出脚本:一次3版起步,人挑人改;AI写初稿,方向、事实、风格人把关
✍️ 自测题
- 分镜脚本要写清楚哪三样东西?(答案提示:每个镜头拍什么画面、说什么话、拍多久)
- 口播稿为什么不能像写文章那样绕弯?(答案提示:口播稿是写给人听的,短句口语、一听就懂;视频开头3秒抓不住人就被划走)
- 为什么AI出脚本要"三版起步人挑"?(答案提示:AI写初稿、人做决定,第一版常不对味;三版给自己挑选余地,也逼AI多角度想)
讲解:文生视频就是输入一句描述,AI直接生成几秒到几十秒的动态画面——不用实拍、不用摄影棚。比如输入"一杯冒着热气的咖啡放在木桌上,晨光从窗户照进来",AI就给你一段这样的空镜。常用工具有即梦、可灵、智谱清影、海螺AI、通义万相等,一般每天有免费额度(以官网最新公示为准)。适合产品演示、氛围空镜、活动预告。
为什么重要:没有拍摄条件也能有"画面"。但AI生成的人物动作、文字、细节容易"崩"——多根手指、文字乱码、口型对不上。AI视频只能当"素材"用,不能当"成品"直接用,这是用文生视频最重要的心态。
讲解:图生视频是上传一张图片(自家商品图、门店照片、菜品图),AI按你的描述让画面动起来——热气升腾、商品转一圈、顾客进店。比起文生视频,图生视频的画面更可控、更像"自己的店",因为底图是你自己的实拍。可灵、即梦等工具都支持,一般也按每日额度使用。
为什么重要:小店最宝贵的素材就是自家实拍图。图生视频把"一张照片"变成"一条视频",是成本最低、最贴近真实经营的AI出片方式——不用重新布置、不用找演员,一张老照片也能变成动态片段。
讲解:网上找的图片视频、热门歌曲、别人露脸的照片,未经授权商用都可能侵权;即使只用几秒音乐片段也可能构成侵权。安全做法是"先找现成素材、再考虑生成":剪映自带素材库(音乐、贴纸、转场、片头片尾)通常已获平台授权,优先用最安全;Coverr、Pexels、Pixabay、新CG儿等免费素材站要先看授权条款,确认可商用再下载。记住一句口诀:免费≠可商用。
为什么重要:侵权不只是"删视频"那么简单,轻则下架限流,重则赔钱吃官司——有银行就因用音乐当短视频背景音乐被判侵权赔偿。养成"素材先查授权、拿不准就换"的习惯,发布才安心,这也是发布检查清单里的固定一项。
📌 本章小结
- 文生视频一句话出画面,适合空镜和氛围;AI片段当"素材"不当"成品",逐条检查细节
- 图生视频让自家照片动起来,成本最低、最像自己的店,是普通小店最划算的出片方式
- 素材合规:平台素材库优先、外部素材看授权,免费≠可商用,拿不准就换
✍️ 自测题
- 文生视频和素材库各适合什么场景?(答案提示:文生视频适合没有现成画面的空镜、氛围、活动预告;素材库适合找现成音乐、空镜、转场,先找现成的再考虑生成)
- 为什么AI生成的视频片段不能当成品直接用?(答案提示:人物动作、文字、细节容易崩,要逐条检查;崩得厉害就重新生成或换实拍/素材库)
- "免费"的素材一定能商用吗?(答案提示:不一定,免费≠可商用,用前看授权条款;平台自带音乐库通常已获授权,最安全)
讲解:剪映是零基础学员第一个要装会用的工具。它的AI能力主要有三件:一键成片(导入素材后说"帮我剪个XX视频",自动选高光、配BGM、加转场)、自动字幕(一键识别画面里的说话内容生成字幕)、智能剪辑(AI助手听懂指令帮你初剪)。AI出初剪,人做微调,半小时出片不再是梦——把"会不会剪辑"的门槛直接抹平。
为什么重要:以前剪片子要学轨道、转场、卡点,现在导入素材、说一句话、微调几处,就能出一版能看的成片。机器之心的实测显示,剪映AI初剪仍需要人工修改文案、字幕和细节——AI负责快,人负责把关,这正是"人机分工"在剪辑环节的落地。
讲解:AI配音就是输入文字、选一个音色,几秒钟生成一段人声。剪映里有内置配音音色;讯飞智作、魔音工坊、配音阁等工具可选更多音色、语速和情感。声音克隆则是用你自己的声音样本训练一个"AI版自己",以后输入文字就能用你的声音念稿。新手先不用急着玩克隆,把"选对音色+像人一样断句"练好就够了。
为什么重要:配音是口播视频的"声音门面"。音色、断句、语速不对,就是满屏"AI味",观众秒划走。选一个自然、亲切的音色,把语速调到正常说话的速度,在长句中间手动加停顿,听起来才像人。
讲解:数字人就是AI生成的"虚拟主播"。在度加、腾讯智影、讯飞智作等工具里选一个数字人形象,输入文案,系统自动配语音、口型、字幕,生成"真人感"口播视频——整套流程就是"文案→配音→数字人→合成"。不想露脸的店主、社恐的人做口播号、带货号,数字人就是"门票"。更进一步还有数字人直播:用数字人形象+预设话术自动开播,自动讲解产品、回复常见问题,填补真人不在的时段。
为什么重要:不用出镜、不用背词也能做口播视频;数字人直播还能把"营业时间"从8小时变成24小时,真人只管最值钱的黄金时段。但直播里用数字人必须让观众知道,并按平台规则标明AI身份——这是合规底线,不是建议。
📌 本章小结
- 剪映AI三件套:一键成片、自动字幕、智能剪辑,AI出初剪、人做微调
- 字幕必须人工过一遍错别字;配音选自然音色、短句、加停顿,去掉"AI味"
- 数字人让口播不出镜,数字人直播24小时守摊;用数字人必须按平台规则标AI身份
✍️ 自测题
- 剪映的AI能帮你做哪三件事?(答案提示:一键成片、自动字幕、智能剪辑;AI出初剪,人要微调改错)
- 为什么AI识别的字幕必须人工核对?(答案提示:方言、同音字、专有名词常识别错;字幕是给观众看的门面,错别字劝退观众)
- 数字人直播有什么要注意的?(答案提示:必须让观众知道是数字人,并按平台规则标明AI身份,否则可能被补标、限流、下架)
讲解:标题、封面、发布时间是发布时的三件套。封面是视频的"门面":大字、重点信息、竖版9:16,一眼看出这条视频讲什么;标题是"钩子":说清"看完能得到什么",而不是"我发了条视频";发布时间选目标观众最活跃的时段,比如做早餐内容就赶在清晨发出。抖音创作者中心支持单独设置封面、标题和话题标签。
为什么重要:平台推荐再多,封面标题不行也没人点。这是新手最省力、见效最快的优化点——同一条视频,换个封面标题,播放量可能差十倍。把三件套当成发布前必做的一步,而不是随手填。
讲解:国家网信办等四部门发布的《人工智能生成合成内容标识办法》自2025年9月1日起施行:AI生成的文字、图片、音频、视频都要加"AI生成"显式标识,文件里还带隐式标识(普通用户看不见,用于溯源)。抖音发布AI内容时,选"高级设置→发文助手自主声明→内容由AI生成"即可打标;不标,平台会检测并补标"疑似使用了AI生成技术"。微信等平台也要求用户发布AI生成合成内容时主动声明。
为什么重要:这是法律法规,不是建议。口播、带货、直播里凡是用AI生成的部分都要标识;平台会检测、会补标、会处置,别抱侥幸。主动打标是顺手就能做对的事,合规不是束缚,是让你放心用AI的安全带。
讲解:发布不是终点,看数据、改下一版才是。重点看三个数:完播率(多少人看完了这条视频)、互动(点赞、评论、转发、到店/询价)、粉丝增长。数据会告诉你"哪几秒被划走、哪条内容有人问",下次照着改:开头不够抓人就换钩子,字幕看不清就放大,这个时段没人看就换时段。每次只改一件事,改完再看数据,形成"发布→看数据→迭代"的循环。
为什么重要:数据迭代的威力在真实经营里已经被验证:内蒙古一家荞麦枕企业用AI数字人实现7×24小时直播、0.8秒实时智能问答(准确率超95%),日均直播时长从8小时提升至24小时,触达用户增加2.3倍,直播间转化率从8%提升到15%,点击率增加35%。数据不撒谎,照着数据改,进步看得见。
📌 本章小结
- 发布三件套:大字竖版封面+钩子标题+对的时间,决定观众"点不点开"
- AI生成内容必须标识:《人工智能生成合成内容标识办法》2025年9月1日施行,抖音等平台会检测补标,主动打标不吃亏
- 数据复盘看三样:完播率、互动、粉丝增长;发布→看数据→迭代,一次只改一件事
✍️ 自测题
- 发布三件套是哪三样?(答案提示:标题、封面、发布时间;封面大字竖版,标题写清"看完能得到什么")
- AI生成的视频发布前要做什么?(答案提示:打AI标识,抖音在"高级设置→发文助手自主声明→内容由AI生成";不标会被平台补标、限流甚至下架)
- 数据复盘重点看哪三个数?(答案提示:完播率、互动、粉丝增长;照着数据一次只改一件事)
- AI写口播稿:在任意对话AI里告诉它"我是谁、卖什么、给谁看、在哪发、想达到什么目的",让它出3版15秒口播稿;人挑一版改成自己的话——短句、口语、开头3秒有钩子,价格和营业时间等事实自己核对
- AI配音或数字人:用剪映内置配音(选自然音色、调慢语速、手动加停顿),或度加/讯飞智作的数字人,输入定稿文案生成配音或数字人口播画面
- 配素材:画面不足时,用图生视频(自家照片动起来)、文生视频(空镜)或剪映素材库补齐;用外部素材先看授权条款
- 剪映合成+字幕:导入素材,用剪映AI一键成片或手动拼,设9:16竖屏;自动识别字幕并整条核对错别字,容易错的词加进词库
- AI标识+发布检查:发布时在抖音"高级设置→发文助手自主声明→内容由AI生成"打标;逐项检查画面比例、清晰度、字幕、封面标题、素材版权
作业
**要求**:为小店(或自己)做一条15秒竖屏口播视频,全程用AI工具,覆盖"脚本→素材→剪辑→字幕→发布"全流程,并按合规要求打AI标识。
**步骤**:
- AI写口播稿:在任意对话AI里告诉它"我是谁、卖什么、给谁看、在哪发、想达到什么目的",让它出3版15秒口播稿;人挑一版改成自己的话——短句、口语、开头3秒有钩子,价格和营业时间等事实自己核对
- AI配音或数字人:用剪映内置配音(选自然音色、调慢语速、手动加停顿),或度加/讯飞智作的数字人,输入定稿文案生成配音或数字人口播画面
- 配素材:画面不足时,用图生视频(自家照片动起来)、文生视频(空镜)或剪映素材库补齐;用外部素材先看授权条款
- 剪映合成+字幕:导入素材,用剪映AI一键成片或手动拼,设9:16竖屏;自动识别字幕并整条核对错别字,容易错的词加进词库
- AI标识+发布检查:发布时在抖音"高级设置→发文助手自主声明→内容由AI生成"打标;逐项检查画面比例、清晰度、字幕、封面标题、素材版权
**验收标准**:竖屏9:16;口播清楚、无明显"AI味";字幕无错别字;全程用AI工具且有AI标识;时长15秒左右(±5秒);五步流程都留下记录(口播稿、配音/数字人、素材、成片、发布截图各一张)。
**示例成品**:
参考调研包里喀什早餐店主阿卜拉江的做法(案例改编自调研包,来源:石榴云/新疆日报2026-07-26):他一个人运营6家早餐店,给新店做一条15秒口播视频——AI按"我是包子店老板,给附近居民看,想引流到店"出了3版口播稿,他挑了"3块钱,吃饱还能打包"这版改成自己的话;用剪映AI配音念稿,配AI生成的"蒸笼冒热气"空镜和自家实拍的门店画面;合成时自动识别字幕,逐条核对"包子""营业时间"没写错;发布时勾选"内容由AI生成",标题用"这家店的包子,3块钱能吃饱吗",封面用热气腾腾的包子特写。一条15秒的引流视频,从写稿到发布,一个人用AI半天就能跑完。
## 学完去哪
- 学完本课,进入下一课:10(课程名与链接以AI学堂官网课表为准)
- 本课配套实操记录:《15秒口播视频检查清单》——随课发放,含发布前逐项核对(比例/字幕/AI标识/版权)和"定位三问+口播稿模板",照着填就能用
- 延伸课程:02《提示词工程》——把"我是谁、卖什么、给谁看"喂给AI的问法练到极致;04《用AI做内容》——AI写文案、做内容的底层逻辑;05《用AI做图》——做封面、做配图先会用AI做图;03《和AI对话与纠错》——核对AI答案、让它说明"改了什么"时用得上
