COURSE 15 · 三阶段 · 进阶与效率 · 视频进阶课

数字人与配音· 课程页

视频出镜不用露脸,声音不用自己录——数字人和AI配音,让一个人也能"天天出镜"。

11. 懂数字人:是什么/能干什么/别神话
22. 会选工具:剪映/智影/度加,按需选
33. 会AI配音+声音克隆:用法和边界
44. 会口播全流程:文案→配音→数字人→合成
55. 懂合规伦理:深度合成规定/肖像权/AI标识
课程思维导图 · MINDMAP
AI 生成课程思维导图
第1章第1章 数字人是什么:AI版的"你"
1.1 数字人=形象+声音+AI驱动

讲解:数字人就是"AI版的出镜人":一个虚拟形象(真人形象克隆或卡通形象)+声音(AI配音或声音克隆)+AI驱动(根据文案说话、对口型、做表情)。你把文案给它,它就能像主持人一样"出镜"念稿。它不是你,也不是演员——是一个"按稿出镜的工具人"。理解这一点,才知道怎么用:把它当"不用休息的主持人",不把它当"真人替身"。

为什么重要:数字人解决的是"出镜难"——不想露脸、没时间录、录了老NG,数字人都能补上。它是"出镜工具",不是"人"。

> 邯郸一家服装厂用"真人+AI"融合直播:真人主播讲白天场,AI数字人主播顶夜场——24小时不歇业,直播间半夜也有生意。(案例改编自调研包,来源为公开报道)
常见误区:以为数字人"和真人一样"。数字人表情、互动、临场反应都有限——它是"按稿出镜",不是"随机应变"。定位对,才用得顺手。
1.2 能干什么:口播视频、直播、带货

讲解:数字人三个主流用法:①口播视频——给文案,出出镜视频(知识口播/产品介绍),最常用;②直播——数字人直播带货(24小时在线,真人下场时接班);③带货视频——产品介绍视频批量出(文案改一改,视频出一条)。对我们普通人,先用"口播视频"——门槛最低,出镜类视频全包了。

为什么重要:数字人把"出镜"从"要人"变"要稿"——会写文案(05课),就会出视频。门槛一降,日更出镜视频成为可能。

> 徽记食品的老板做了个"数字分身",现场产出5条带货视频——老板本人录1条的时间,数字分身出了5条。(案例改编自调研包,来源为公开报道)
常见误区:一上来就想做"数字人直播"。直播门槛高(平台规则/流量/运营),先做口播视频练手——视频做好了,直播是下一步。
1.3 别神话:数字人的边界

讲解:数字人的三个"还不像":①口型——长句快语速口型会跟不上;②情绪——激动/幽默/哭,表情都偏平;③互动——直播时观众提问,数字人答不了即兴问题(要靠脚本和人工切).看到"不像"的部分,不是工具差,是技术边界——接受边界,用对场景:口播/介绍/通知类,数字人够用;情绪/互动/临场类,真人上场。

为什么重要:期望管理决定体验——知道数字人"哪里不行",才不会用了之后失望弃用。

> 数字人适合:"今天教大家3招挑西瓜"(平稳口播);不适合:"和观众现场唠嗑、接梗"(要真人)。场景选对,数字人就是好员工。(示例为教学演示)
常见误区:数字人做啥都行。口播类数字人够用,互动类还得真人——"数字人做口播,真人做互动",分工最合理。 >
AI 生成流程图
assets/flows/15-01.svg(文案→数字人形象→配音→合成→发布) · 点击图片可放大

📌 本章小结

  1. 数字人=形象+声音+AI驱动,是"按稿出镜的工具人"
  2. 三个用法:口播视频/直播/带货,先玩口播
  3. 边界要认清:口型/情绪/互动还不像,口播类够用

✍️ 自测题

  1. 数字人三要素?(答案:形象+声音+AI驱动)
  2. 普通人最先用数字人做什么?(答案:口播视频,门槛最低)
  3. 数字人的三个边界?(答案:口型/情绪/互动)
第2章第2章 工具怎么选
2.1 上手顺序:剪映→智影/度加→专业工具

讲解:数字人工具不用一上来选"最专业的",按顺序上手:①剪映——你手机/电脑里可能就有,剪辑+数字人+配音一体,零门槛第一站;②腾讯智影/度加——网页版,数字人形象多,免费额度够体验;③专业工具(讯飞智作/硅基智能等)——配音质量、数字分身定制更强,进阶再说。顺序的逻辑:先用免费的练手,需求明确了再升级。

为什么重要:工具从简到专,成本从零开始——先用剪映做出第一条,比研究十天"哪个工具最强"有用。

> 我们的推荐路径:剪映(第一条数字人口播)→智影/度加(形象更多)→讯飞智作(配音更专业)——每一步都在前一步基础上加能力,不跳级。(示例为主编实践,工具见调研包清单)
常见误区:一开始就纠结"哪个工具最好"。没有最好只有适合——剪映能出的片,先出再说,需求升级工具再升级。
2.2 三类工具:剪辑内置、网页数字人、专业配音

讲解:数字人工具分三类,各管一段:①剪辑内置型(剪映)——剪辑+数字人+配音全包,方便;②网页数字人型(智影/度加/闪剪)——专注数字人,形象多、模板多;③专业配音型(讯飞智作/魔音工坊)——声音质量高,多音色/情感调节。用法:小片用剪映一条龙,要更多形象用网页数字人,要声音质量用专业配音——按需组合,不是只用一个。

为什么重要:三类工具是"组合拳"——知道各管什么,才知道"想要更好的形象去哪找,想要更好的声音去哪配"。

> 一条口播视频的组合:剪映剪素材+智影选数字人形象+讯飞智作出高质配音——三个工具各干各的强项,成片质量拉满。(示例为教学演示)
常见误区:只用一个工具啥都干。工具各有所长,组合用效果最好——剪映一条龙方便,但形象和声音质量有限。
2.3 免费额度先用:从零成本开始

讲解:大部分数字人工具都有免费额度:剪映数字人有免费次数,智影/度加有免费体验,配音工具有免费试用。起步策略:先薅免费额度——做出你的第一条数字人视频,验证"这事我干得了",再决定要不要付费。付费前算笔账:一个月要出多少条?付费值得吗?免费+少量付费,是普通人起步的最优解。

为什么重要:成本控制是普通人玩数字人的前提——免费额度够你试水,试明白了再花钱,不交学费。

> 我们起步时全用免费:剪映免费次数出前3条,智影免费额度试形象,确认"数字人适合我们"后才考虑付费工具——零成本试错,不花冤枉钱。(示例为主编实践)
AI 生成流程图
assets/flows/15-02.svg(要做什么?→口播视频→剪映;直播→专业工具;配音→配音工具) · 点击图片可放大

📌 本章小结

  1. 上手顺序:剪映→智影/度加→专业工具,从简到专
  2. 三类工具组合:剪辑内置/网页数字人/专业配音,按需组合
  3. 免费额度先用:零成本试水,确认价值再付费

✍️ 自测题

  1. 数字人工具上手顺序?(答案:剪映→智影/度加→专业工具)
  2. 三类数字人工具各管什么?(答案:剪辑/形象/配音)
  3. 起步策略?(答案:先用免费额度,确认价值再付费)
第3章第3章 AI配音与声音克隆
3.1 AI配音:文字变声音,多音色可选

讲解:AI配音就是"文字变声音":输入文案,选一个音色,AI念出来。音色选择:男声/女声/知性/活泼/播音腔,按内容配(产品介绍用知性,促销用活泼)。配音工具:剪映自带/edge-tts免费/魔音工坊专业。我们实践的配音经验:视频配音选"云希"类男声(干净利落),桌面App回复用"晓伊"(亲切)——音色和场景匹配,效果差很多。

为什么重要:声音是视频的"第二张脸"——音色对,内容才听得进去。AI配音让"声音好听"不再是天赋,是选择。

> 我们做视频号的配音经验:正式的工具介绍用知性女声(稳重专业),轻松的图文用男声(干净利落)——同一篇文案,音色不同,味道完全不同。(示例为主编实践,音色来自常用配音工具)
常见误区:随便选个音色就配。音色和内容错配(促销用播音腔)很出戏——先定"这段视频什么气质",再选音色。
3.2 声音克隆:用你的声音配音

讲解:声音克隆是"进阶玩法":录几段你的声音,AI学会你的音色,之后输入文字就能"用你的声音"念出来——不用录,也能有自己的声音。好处:批量出配音快、声音统一、不用反复录。注意:克隆质量看录音(清晰/安静/有感情),克隆一次,以后所有视频都"你"来念。我们实战验证过:克隆男声效果好,但云端克隆耗额度——先用免费AI音色,确认真需要再克隆。

为什么重要:声音克隆让"你的声音"变成可复制的资产——批量出片时,不用每段都重录。

> 你录3分钟清晰语音,AI克隆你的声音——之后写好的文案,输入即出"你的声音"版配音,一条视频的配音从"录半小时"变"等1分钟"。(示例为教学演示)
常见误区:克隆一次就完美。克隆效果依赖录音质量——环境吵/没感情/语速乱,克隆出来也生硬;先录好音,再克隆。
3.3 边界:克隆要授权、不能乱用

讲解:声音克隆的边界(红线):①授权——克隆"别人的声音"必须本人同意(明星/熟人/同事,没授权就是侵权);②自用——克隆自己的声音没问题,但别人要用你的克隆声音也要你授权;③商用——声音克隆商用有规定,别拿别人的声音赚钱。2024年有首例AI声音侵权案:未经授权用配音演员声音做AI配音,被判侵权赔偿。边界一句话:声音像人脸一样,是有"肖像权"的。

为什么重要:声音克隆是"红线区"——用错一次就是侵权官司。记住:克隆自己随便,克隆别人要授权,商用更要合规。

> 首例AI声音侵权案:配音演员发现自己的声音被未经授权用于AI配音,起诉获赔——声音有"肖像权",克隆别人的声音,先问本人。(案例改编自调研包,来源为法院公开报道)
AI 生成流程图
assets/flows/15-03.svg(文字→选音色/克隆→试听→调整→导出) · 点击图片可放大

📌 本章小结

  1. AI配音:文字变声音,音色配内容(知性/活泼/播音腔)
  2. 声音克隆:录几段→AI学会→文字出"你的声音",批量出片利器
  3. 红线:克隆自己随便,克隆别人要授权,商用更合规

✍️ 自测题

  1. AI配音是什么?(答案:文字变声音,选音色)
  2. 声音克隆的前提?(答案:录几段清晰语音,AI学习)
  3. 克隆别人的声音可以吗?(答案:必须本人授权,否则侵权)
第4章第4章 口播全流程:一条视频的诞生
4.1 文案→配音→数字人→合成

讲解:一条数字人口播视频的标准流水线:①文案——AI写口播稿(05课,30秒≈80-100字);②配音——AI配音或克隆音色(本章第3章);③数字人——选形象,输入配音,数字人开口;④合成——加字幕(自动字幕)、加素材(图片/B-roll)、导出。四步走完,一条"出镜视频"诞生。时间:熟练后一条5-10分钟。我们做视频号图文/视频就是这条流水线。

为什么重要:流程固定,产量才稳定——把"出视频"从"碰灵感"变"走流程",日更才可能。

> 一条"工具介绍"口播视频的流水线:AI写稿(05课)→AI配音→剪映数字人出镜→自动字幕+合成——全程10分钟,一条能发的视频出炉。(示例为主编实践)
常见误区:流程乱跳(先找素材再写稿)。固定顺序(文案→配音→数字人→合成),每一步的产出是下一步的输入——流程乱,时间翻倍。
4.2 数字人"像不像":形象、口型、表情调试

讲解:数字人出片后检查三样:①形象——像不像/自然不自然(真人形象克隆要清晰正面照);②口型——对得上吗(语速快容易掉,放慢语速或剪短句);③表情——自然吗(选"平实"表情比"夸张"安全)。调试方法:换形象/调语速/换表情模板——试2-3轮,总有一版"像样"。别追求完美,观众看的是内容,不是数字人本身。

为什么重要:数字人是"载体",内容才是"本体"——像不像调到"能看"就行,时间花在内容上更值。

> 数字人第一条口型有点跟不上(语速快),把文案改成短句+语速调慢一档,口型对上了——小调整,大改善。(示例为教学演示)
4.3 批量出片:一条文案多个版本

讲解:数字人的杀手锏是"批量":一条文案,改改开头,就能出多个版本(不同平台/不同角度/不同时长)。方法:①平台版——公众号长版/视频号中版/抖音短版;②角度版——同一产品,卖点A/卖点B/卖点C各一条;③系列版——一条文案出"知识/故事/干货"三个系列。批量让"内容量"上台阶——10条文案,出30条视频。

为什么重要:批量是数字人最大的价值——内容平台吃"量",一个人靠批量也能撑起"内容矩阵"。

> 一条"挑西瓜"文案,出3个版本:抖音15秒(纯技巧)/视频号30秒(加故事)/公众号图文(加图文)——一次文案,三份内容。(示例为教学演示)
AI 生成流程图
assets/flows/15-04.svg(文案→配音→数字人→合成→检查→发布) · 点击图片可放大

📌 本章小结

  1. 流水线:文案→配音→数字人→合成,一条5-10分钟
  2. 调试三样:形象/口型/表情,调到"能看"就行
  3. 批量出片:一条文案多版本,一个人撑起内容矩阵

✍️ 自测题

  1. 口播视频流水线四步?(答案:文案→配音→数字人→合成)
  2. 数字人调试看哪三样?(答案:形象/口型/表情)
  3. 批量出片怎么做?(答案:一条文案改开头,出平台/角度/系列多版本)
第5章第5章 合规与伦理
5.1 深度合成规定:数字人是"合成内容"

讲解:数字人、AI换脸、语音合成,在法规上统称"深度合成"——《互联网信息服务深度合成管理规定》管的就是这些:提供深度合成服务要标识、要审核、要防滥用。对使用者:用数字人生成内容,要遵守平台规则、按要求标识、不用于违法用途。记住:数字人是"合成内容",不是"真人实录"——法规管的就是这个身份。

为什么重要:法规是"总规矩"——不懂规矩,轻则限流,重则违规。知道数字人是"深度合成",就懂了一半合规。

> 抖音、视频号等平台已要求:AI生成/数字人内容主动标识——发布数字人视频时,勾选"AI生成"标识,是平台的硬要求。(案例改编自调研包,来源为平台公告)
5.2 肖像与声音权:克隆要授权

讲解:数字人涉及的"两个权":肖像权(脸)和声音权(声音)——用别人的脸/声音做数字人,必须本人授权(民法典规定,人格权不可侵犯)。红线场景:克隆明星脸/熟人声音/同事形象做内容——统统不行。自己的脸/声音:自用没问题,但别人商用你的数字分身也要你同意。一句话:数字人是"你的",才随便用;是"别人的",先问本人。

为什么重要:肖像和声音是"人格权"——侵权不是"道义问题",是法律问题。首例AI声音侵权案已经判赔,红线不能碰。

> 首例AI声音侵权案判赔:配音演员的声音被未经授权用于AI配音,法院认定侵权——脸和声音,都是"人格",克隆使用要授权。(案例改编自调研包,来源为法院公开报道)
5.3 AI标识:发布必标、平台要求

讲解:发布数字人内容的最后一步:AI标识。平台要求(抖音/视频号/快手等都承诺落实AI内容标识):AI生成内容主动声明,数字人直播显著标识,深度合成内容按规标注。做法:发布时勾选"AI生成/AI内容"选项,或文字声明"本内容由AI生成"。标识不是"承认造假",是"诚实告知"——观众知情,平台合规,你安全。

为什么重要:标识是"合规的最后一道"——内容做得再好,不标识被平台补标,照样限流。主动标识=省心。

> 8家主流平台承诺落实AI内容标识:数字人直播要显著标识、AI生成视频要主动声明——发布前勾选标识,是平台规则也是法规要求。(案例改编自调研包,来源为公开报道)
AI 生成流程图
assets/flows/15-05.svg(数字人内容→授权检查→AI标识→合规发布) · 点击图片可放大

📌 本章小结

  1. 数字人是"深度合成内容",法规有《深度合成规定》管着
  2. 肖像+声音是人格权:别人的脸和声音,必须授权
  3. 发布必标AI标识:主动标=省心,不标会被强制补标

✍️ 自测题

  1. 数字人内容受什么法规管?(答案:《互联网信息服务深度合成管理规定》)
  2. 用别人的声音做数字人要什么?(答案:本人授权,否则侵权)
  3. 发布数字人内容最后一步?(答案:勾选AI标识)
  4. 文案:AI写30秒口播稿(80-100字,05课方法)
  5. 配音:选音色或克隆(先免费音色)
  6. 数字人:选形象,输入配音
  7. 合成:加字幕+检查口型
  8. 合规:AI标识+授权检查

作业

**要求**:用剪映(或任一工具)做一条30秒数字人口播视频。

**步骤**:

  1. 文案:AI写30秒口播稿(80-100字,05课方法)
  2. 配音:选音色或克隆(先免费音色)
  3. 数字人:选形象,输入配音
  4. 合成:加字幕+检查口型
  5. 合规:AI标识+授权检查

**验收标准**:口播顺畅/声音清楚/口型基本对/AI标识已标/30秒左右。

**示例成品**:调研包案例3(徽记食品老板"数字分身"现场产出5条带货视频)就是完整示范——一条文案,数字人批量出片。

## 学完去哪

  1. **下一课:16 选品研究员** —— 让AI帮你调研选品、比价、看趋势
  2. 配套实操记录:第9周《数字人上线:视频号口播不用露脸了》
  3. 延伸:09 视频剪辑(AI视频全流程) · 14 营销获客(短视频营销)