店铺里经常出现这样的时刻:活动后天就要上,需要一条视频讲清楚优惠怎么参加;新款今天到货,想发一条预告让老客先知道;详情页卖点写了一大堆,缺一段能让人一口气看完的讲解。这些需求有个共同点,不露脸、不实拍也能做,因为信息都已经写在图和文案里。可多数店铺仍然卡着没做,原因就一个:不知道文案和画面怎么组织成一条像样的视频。
AI图片文字生成视频解决的就是这个问题:把商品图、活动信息和卖点文字发进去,AI把图按顺序铺开、把文字排到画面上,再配上切换节奏,一条能投放、能发圈、能进详情的信息型视频就出来了。卖家要准备的是图和一句句想说的文案,分镜、排版、配音交给工具完成。青虎AI是对话式电商作图工具,输入商品图片和需求描述即可生成图片或视频,支持AI商品主图、AI图片处理、AI视频处理、AI商品图一键生成视频等能力,图文视频这类需求把内容说清楚就能生成,支持批量处理。
图文视频的门槛不在生成,在文字。同样的图片,文案写得好不好、排得清不清楚,决定视频是专业还是廉价。买家在手机上划动着看,一屏就两三秒,文案太长读不完,字号太小看不清,字幕和画面错位,整条视频就垮了。这篇文章按新手最容易踩坑的顺序来讲:先分清要做的内容属于哪一类,再给文案和排版的执行规则,然后是字幕配音和时长的配合方法,最后落到用青虎AI从文案清单到成片的操作步骤。
阅读建议:有现成任务的,直接按第七节把图片和文案整理好去生成,再用第四、五节的规则检查文字;想建立长期产出能力的,重点看第二节的内容分类和第六节的屏数规划,把模板沉淀下来,之后每条视频往模板里填内容就行。文中时长字号均为常规经验值,以实际投放位置的规则为准。
一、图文视频适合哪类内容:两个条件加一个边界
判断一个需求适不适合做图文视频,先过两个条件:信息能不能拆成一屏图配一句短文案的形式,让每条信息用一句话就说清;内容是否需要人物出镜、真实动作过程来支撑。两个条件前者满足、后者不需要,就适合;反过来,要靠表演和现场感取胜的内容,图文视频承载不了。
从这个判断出发,电商里最合适的三类内容浮出水面。活动宣传是最典型的图文视频场景,优惠力度、活动时间、参与方式是结构化信息,配图搭场景、文字讲规则;卖点轮播把一款商品的多条卖点逐条讲,一屏一个卖点,讲完收尾引导下单;上新通告把新品系列、首发信息、预售节奏铺出来,用图建立期待,用文案带节奏。三类占了店铺日常视频需求的大头。
边界也要说清楚:纯参数罗列、步骤教学类的内容不适合。参数表逐项读需要停留,图文视频一屏两三秒装不下;步骤教学需要画面连贯,图片跳切会把步骤切断。这类内容交给详情图文或实拍,图文视频只承接讲清价值、推动点击的信息型内容,各司其职,素材效率最高。
一段话判断要不要用图文视频
把想传达的内容试着写成三到五条短句,每条一句话能说清一个点,且不需要画面表演,这套内容就适合图文视频。需要逐条读表格、需要演示连续动作的内容,换用图文详情或实拍。判断花不了半分钟,却能避免做出一条不伦不类的视频。

图1:图文视频的画面是图片加大字文案的组合,一屏只承载一句核心信息
二、先分清做哪类:活动通知和卖点轮播是两种拍法
很多人把活动视频和卖点视频当成一回事,直接套用同一种写法,结果活动视频像卖点罗列,卖点视频又看不出优惠重点。两类内容的目标观众状态不同:看活动视频的人想知道这次有什么便宜,看卖点视频的人想知道这款凭什么值得买,两种心态决定了文字和画面要分开设计。
| 对比维度 | 活动通知视频 | 卖点轮播视频 |
|---|---|---|
| 目标 | 让买家知道活动并参加 | 让买家理解卖点并下单 |
| 核心信息 | 力度、时间、参与方式 | 差异卖点、使用场景、价值 |
| 文案语气 | 紧迫、直接、行动导向 | 解释、对比、建立信任 |
| 收尾动作 | 立即下单、限时提醒 | 规格确认、引导咨询或加购 |
| 常见时长 | 9-15秒为主,短促有力 | 15-30秒,讲透再收 |
活动视频的文案围绕三个要素组织:什么便宜了、便宜到什么时候、怎么买。开场屏直接亮力度,比如全场满减、第二件半价,不必铺垫;中间屏交代范围和玩法,哪些商品参加、门槛是多少;收尾屏压上时间限制,把紧迫感收在行动指令上。活动视频最忌讳的是把每个参加活动的商品卖点都讲一遍,买家看完记住了商品,忘了活动怎么参加。
卖点轮播的文案围绕决策顺序组织:开场用痛点或利益点留住人,中间按决策权重逐条讲卖点,最影响下单的判断放前面,收尾落到购买动作。它和活动视频的区别在于收尾:活动视频收在限期优惠上,卖点视频收在商品价值确认上,一个推的是机会,一个推的是产品,方向别混。
两类内容也可以组合:主打款用卖点轮播建立认知,另出一条活动版讲优惠,投放时按图位选用,比硬塞在一条里两头不讨好高效得多。
三、一屏讲一个点:图文视频的屏结构与文案写法
图文视频的叙事单位是屏,一屏等于一张画面加一句主文案加一次停留。写内容时以屏为单位逐屏设计,先定这条视频有几屏,再逐屏填画面和文案,不要先想整条视频再回头补画面。按功能,一屏可以分为四种类型。
开场屏
开头几秒讲清这条视频的主题,放痛点或最大利益点,任务是不让人划走。
卖点屏
一屏讲一个卖点,按决策权重逐条排,主体画面加一句短文案。
展示屏
画面权重高、文字精简,给出商品全貌或使用场景,让买家喘口气。
收尾屏
价格、活动期限或下单引导收在最后,把观看变成动作。
文案的写法有规律。一屏只写一句,一句话只讲一个点;句子用短句,主谓宾说清这个商品有什么、带来什么好处;动词优先,能说自动折叠就不说具备折叠功能;卖点排序按决策权重,先讲影响下单最大的。写草稿时先放开多写几屏,再逐屏删到目标屏数,留下来的每一句都要能单独成立。
开场屏和收尾屏各有写法定式。开场要么抛痛点引起共鸣,要么直接亮利益点,把值得看的理由提前到第一句;收尾固定做行动引导,把价格、期限、下单入口放进来,文案落在现在下单、抢先购、限时价这类带动作的词上。主文案避免堆形容词,同是讲静音,很安静不如静音送风,静音送风不如低至二十三分贝,可验证的数字和结果比抽象形容可信得多,能被形容词替换掉的句子就是空话。
四、文字排版:手机小屏上看不清等于白做
图文视频绝大多数在手机小屏上被观看,排版的唯一底线是小屏划动中一眼读清。排版规则落到具体数值上,方便直接对照,生成后按这张表逐屏核一遍。
| 排版要素 | 建议标准 | 判断依据 |
|---|---|---|
| 单屏主文案字数 | 12字以内 | 超过一行半就拆短 |
| 主辅文字层级 | 主文案字号约为辅助文字两倍 | 买家先看到谁要明确 |
| 文字安全边距 | 距屏幕边缘留出约10% | 防止平台裁剪切字 |
| 文字与背景 | 主文案压深色半透明底 | 保证任何画面都可读 |
| 字体数量 | 全片不超过两套 | 一套粗黑标题加一套常规体 |
单屏字数是最先要卡的线。图文视频的文字是给划动中的买家扫读的,不是细读的,主文案十二个字以内,价格标签这类辅助信息再短一截。句子超过一行半就拆短,一屏的文字密度永远让位给清晰度。
文字层级解决先看哪里的问题。主文案和辅助信息要有明确主次:主文案大号粗体、高对比色,辅助信息细体小号弱化;同一段视频里主文案固定在同一个视觉位置,买家形成阅读惯性后,扫读效率明显提升。安全边距和背景是手机端硬约束:屏幕边缘在播放和裁剪时都可能被切,文字离边太近有风险,上下左右留百分之十左右的边距是通用保险线;复杂商品图上直接压字是最常见的翻车点,主文案区域要么选画面干净留白处,要么叠一层半透明深色底,任何画面下文字都可读才算过。
字体的选择要克制,标题用常规粗黑体系就够,电商图文视频不靠字体花样取胜,一套加粗负责主文案、一套常规负责辅助文字,全片只两套。颜色对比以手机亮度减半仍可读为准,浅底配深字、深底配浅字加底,是最稳的组合。排完版缩到手机尺寸逐屏看一遍,字号、对比、贴边问题在这一步全部现形,别在大屏上验收。

图2:同样的文案,规范排版一眼读清,堆砌排版在小屏上完全不可读
五、字幕与配音:信息双通道不能断
图文视频加了配音和字幕,信息密度和观感会上一个台阶。配音让买家不用逐字读,字幕兜底静音场景,两条通道互相配合,观看体验才完整。配合里有几个需要控制的具体环节。
配音文案就是主文案的朗读版,两者必须一致,配音读到第几屏字幕就要跟到第几屏,口播和画面错位是图文视频最明显的制作瑕疵。长度上按语速倒算:常规口播每秒四字左右,主文案十二个字的屏至少留三秒,配两秒的屏就会赶。所以带配音的视频先按文案字数留足屏时长,而不是反过来压缩文案迁就时长。
字幕的位置和断句有规范。字幕跟随口播逐屏出现,固定在屏幕下方安全区,单屏字幕不超过一行;一句话被拆到两屏时,口播和字幕都要在屏边界处断句,句子不能拦腰截断。静音场景下买家要能靠字幕读懂整条视频,字幕承担了一部分文字排版的功能,字号不能小于安全值。
配音字幕的双通道自检
成片做两个检查:关掉声音只看字幕,整条视频的信息能否连贯读完;闭上画面只听话,口播内容能否独立成立。两个通道都完整,视频同时照顾了静音划动和戴耳机两类观看场景;有一个通道断了,说明配音或字幕还有缺口,回炉补上再发布。
背景音乐与配音是配合关系:配音为主,音乐为辅,音量压低到不干扰口播的程度。需要卡点的视频把屏切换对准音乐节拍,切换的节奏感会强化流畅度。没有配音的版本,音乐承担节奏功能,按节拍安排每屏切换就是主要的节奏手段。音乐优先使用素材库内可直接商用的曲目,别搬短视频平台的热门配乐,投放量级上来会被下架。
六、时长与屏数:按用途先排容量再填内容
图文视频的时长由投放用途决定,用途定了屏数就有了上限。规划时先定秒数,再按时长倒推屏数,最后决定哪些信息进、哪些信息砍,顺序反了内容就会超载。
常规档位给三档参考:9到15秒的短版适合主图位、社群和轻量内容,容纳四到六屏,只讲一两个核心卖点加一个行动引导;15到30秒的中版适合详情页和站外信息流,容纳八到十二屏,卖点讲全,穿插展示屏和品牌收尾;超过一分钟不建议用图文形式做,信息量撑不住,完播率掉得快。
画面比例按投放位选:3:4竖版覆盖绝大多数电商图位,9:16适合全屏竖屏的短视频场景,1:1适合方形图位和部分社群。比例影响文字排版空间,竖版比方形上下更宽裕,主文案字号可以更大。同一个内容源需要多比例版本时,用AI按不同比例各生成一版,文字自动适配位置,不要直接拉伸原画面,变形后的文字阅读体验明显变差。
投放前最后检查两处:自动循环的图位,收尾屏和开场屏要能自然衔接,收尾引导语不要和开场冲突;首帧画面按静态主图标准单独优化,首帧往往是第一屏文字标题,缩略尺寸下可读与否直接决定点开率,值得单独花时间。
七、用青虎AI把图文生成视频:从文案清单到成片
文字、排版、规格的规则都在前面了,把生成流程落到青虎AI上。图文视频以素材和文案为输入,四步走完能拿到一条可投放的成片。
步骤一:图片按屏排序,文案逐屏写清
按分镜把每屏要用的图片排好顺序,按屏次命名,一屏一张。把每屏的主文案写成逐条清单,一屏一条、每条独立成句,活动视频写清力度与时间,卖点视频写清卖点与价值。文案清单是生成时最重要的输入,整理得越干净,成片文字越利落。
步骤二:定好用途、时长与声音方案
确认这条视频的最终落点,按落点定时长和比例,例如投详情页选30秒3:4竖版,投活动群发选9秒9:16。再把声音方案定下来:要不要配音、配什么风格的音乐、字幕是否保留。规格在发起前定完,避免生成后因格式不符返工。
步骤三:上传素材,把需求一次说清
把按序图片和逐条文案一起交给青虎AI,用需求描述说清规格与风格,例如用这6张图和对应文案生成12秒图文视频,3:4竖版,逐屏轮播,文字大而清晰,加普通话配音和字幕,配轻快背景乐。图片、文案、规格三层信息一次交代清楚,生成的视频基本可用。
步骤四:逐屏核对文字,合格后存模板
生成后逐屏核对三件事:主文案有没有错字和断句问题、文字在小屏上是否清晰可读、字幕和口播是否同步。哪屏有问题就指出屏次单独调整,例如第3屏文案太长,拆成两行并缩短。一版确认后把屏型结构、文案格式和字体配色存成模板,后续同类内容批量套用。

图3:图文视频的制作流程,文案清单的干净程度决定成片的可用程度
整条流程里真正花时间的是步骤一的文案整理,生成环节很快。文案整理得好,AI生成的视频只需微调;文案潦草,成片文字几乎全要返工。模板沉淀下来,三类内容都能按同一套流程快速产出。
八、图文视频的四个误区
图文视频的常见问题集中在文案和排版,翻车点很集中,逐个拆开。
误区一:把详情页文案整段搬进视频
详情页文案是给细读场景写的,句子长、信息密度高;视频文案是给扫读场景写的,一屏两三秒装不下整段。图文视频的文字必须按屏重写,一屏一句、一句一个点,详情页素材可以复用,表达要按媒介重来。
误区二:一条视频把卖点全塞进去
一款商品十几条卖点全塞进15秒,每条一闪而过,买家一条都记不住。卖点轮播要挑:短版只讲两三个差异化卖点,其余留给详情页,一条视频能让人记住一个卖点就成功了,记住三个就是超水平。
误区三:字幕就是配音的复读,不对齐
字幕和口播内容一致只是第一步,逐屏对齐才算完成。口播已经讲到下一屏、字幕还停在上一屏,观感立刻崩掉。生成后逐屏检查字幕与口播同步,一句话跨屏就调整断句位置,别把检查省了。
误区四:只在大屏验收,不看小屏观感
大屏上字号、对比都合适的文字,缩到手机小屏可能完全不可读。图文视频是典型为小屏设计的内容,生成后缩到手机尺寸逐屏看,文字太小、对比不足、贴边裁切的问题会全部暴露,这一遍省不得。
四个误区的共性是拿别的媒介的习惯套视频:把视频当海报、当说明书,忘了图文视频的观看环境是划动中的小屏,这一屏只给买家一个能瞬间看懂的信息。
九、让图文视频稳定出效果的四个技巧
绕开误区之后,给四个能直接提升图文视频质量的执行技巧。
技巧一:文案初稿多写,定稿删半
写分镜时先放开写,把能讲的卖点、能用的活动话术全列出来,再按目标屏数删到一半。删的过程就是排序的过程,留下的都是关键信息。初稿写不满说明内容准备不足,定稿删不动说明没分清主次,两个信号都能提前暴露问题。
技巧二:开场屏一句内给出必看理由
前几秒决定买家划不划走,开场屏要在第一句给出利益点或痛点,把看下去的理由前置,哪怕牺牲一点悬念。信息型图文视频不靠悬念留人,靠的是快速兑现价值,开场文案值得反复改。
技巧三:文案字数反推屏时长
先定每屏主文案字数,再按字数分配停留:纯字幕屏按每秒四字,带配音按语速留足缓冲。反过来只定时长再塞文案,字幕容易赶或空。文案与时长匹配是图文视频节奏的基本功,两条线对齐了画面才不赶。
技巧四:内容分类沉淀三套模板
把活动宣传、卖点轮播、上新通告各沉淀一套模板,固定屏型结构、主文案位置、配色和字体。青虎AI支持批量,新品或新活动只需替换图片与文案即可批量生成。模板化的结果是风格统一、效率稳定,运营把精力留给内容本身。
四个技巧分别管内容取舍、开场钩子、节奏匹配和模板复用,前三个提升单条质量,第四个解决批量效率。图文视频的核心能力是稳定产出,把技巧沉淀成流程,店铺的日常视频供给就有了保障,不用每次从零开始。
十、三个店铺用图文视频的落地场景
看三个应用场景,分别对应活动预告、广告素材和上新详情三种常见需求。
场景一:美妆店用活动清单视频代替逐条通知
一家美妆店大促期同时有满减、赠品、主推套装三条信息,逐条发通知既啰嗦又没人看全。运营把三张商品图配上三条短文案,合成一条9秒竖版活动视频:开场亮全场满减,中屏分别带出赠品和主推套装,收尾压上活动时间。一条视频讲清全部活动,发到社群和店铺页,活动信息一次触达,咨询明显变少而集中。
场景二:数码配件店用卖点轮播当广告测素材
一家卖充电配件的店铺,广告素材一直用静态图,跑量平平。运营把快充协议、接口兼容、散热结构三个卖点各配一张图,写成三句短文案,合成15秒卖点轮播视频,再按不同首帧出了几个版本投广告计划。点击数据反馈后留下效果好的版本放量,测素材的成本被压到极低。
场景三:家具店把上新系列做进详情页开头
一家上新材料系列收纳柜的店铺,新材质是最大卖点但详情页图文讲不透。运营把材质对比图、结构图、场景图排好序,配上三条文案合成30秒上新视频,放进详情页顶部。买家进店先看一段带讲解的上新视频,对新系列的认知比翻图快得多,详情转化同步改善。
三个场景的共同点:素材只有图加文案,却都在紧的节点把信息讲清楚了。活动一次讲清、卖点快速测版、上新系统讲解,同一套方法覆盖三类需求。

图4:活动一次讲清、卖点快速测版、上新系统讲解,图文视频覆盖三类高频内容需求
十一、总结:图文视频是把图和文案变成视频产能的方法
总结:图文视频的制作框架
AI图片文字生成视频适合信息能拆成图加短句的内容,活动宣传、卖点轮播、上新通告是三大高频场景,纯参数罗列和步骤教学不适用。开工前先分清做哪类:活动通知围绕力度、时间、参与方式组织文案,收尾压在限期行动上;卖点轮播按决策顺序讲卖点,收尾落在商品价值确认上,两类写法不混用。内容以屏为单位组织,开场屏给必看理由、卖点屏一屏一点、收尾屏做行动引导,主文案十二字以内、一句一个点、动词优先、用可验证的数字代替形容词。排版守住四个数值标准:单屏12字、主辅字号拉开两级、四周边距留10%、文字压半透明底,字体全片不超过两套。字幕配音做双通道自检,配音与字幕逐屏对齐、静音可读、闭屏可懂,屏时长按语速倒算。执行时用青虎AI,把按屏排序的图片和逐条文案清单发进对话,一次说清时长、比例、配音和字幕方案,逐屏核对后把模板沉淀成店铺资产,活动与上新批量套用。图文视频的竞争力在稳定的内容产出能力,文案精简、分镜先行、模板复用,三个动作就能让它成为日常运营的固定工具。
十二、常见问题解答
问:图文视频和图片轮播有什么本质区别?
图片轮播只有画面切换,信息靠买家自己读图;图文视频多了一层文字信息结构,每屏用一句文案把画面信息提炼出来,还带配音和字幕。信息被结构化提炼是核心差异,适合卖点讲解、活动说明这类需要明确传达的内容,让买家不用猜重点。
问:没有专门的宣传图,用主图当画面可以吗?
可以。商品主图、场景图都可以直接用作画面,重点是文字承担信息主体。用主图时挑主体清楚、留白够的,给文案留出干净区域;主图本身信息太满的,先让AI换一张干净底图再上文字。
问:一句主文案写多长合适?
控制在12字以内,6到10字观感最佳。辅助信息如价格标签再短一截。判断标准是手机小屏缩略状态下能一眼读完,读不完的属于超长,先拆短再上屏。文案的价值在点出重点,不在把话说完。
问:文案太多放不下怎么办?
拆屏或者砍信息,不要缩字号硬塞。一屏超过一行半的内容拆成两条屏,或者按决策权重砍掉最不重要的那部分。图文视频的容量是屏数乘单屏信息量,信息超载时优先砍不是缩,砍到一屏只讲一点为止。
问:字幕一定要和配音逐字一样吗?
内容要一致,但字幕可以做口语化精简,省略口头语和重复词。字幕的目的是配合听觉快速理解,不是逐字誊写配音稿。核心是两者传达的信息相同、节奏对齐,口播到第几屏字幕跟到第几屏,断句位置一致。
问:首帧封面要单独设计吗?
值得单独花时间。图文视频的首帧往往是第一屏文字标题,在列表缩略、静音状态下,标题是否可读直接决定点开率。首帧选信息冲击力最强的画面,文字加大、居中放安全区,缩到缩略尺寸检查一遍,看不清就调。
问:背景音乐怎么选不踩雷?
用素材库内可直接商用的曲目,避免直接搬运短视频平台热门配乐。音乐服务于节奏不抢内容,音量压到不干扰配音的程度。带配音的版本选节奏平缓的底乐,纯字幕版本可以选节拍清晰的音乐用于卡点切换。
问:横版和竖版的图片能混在一条视频里吗?
不建议。画面比例不统一会让视频显得零散,3:4和9:16的素材混用还会出现大面积黑边。同一批素材先统一裁切到目标比例再进视频,构图损失大的图直接淘汰。生成时按单一目标比例描述,出片才整齐。
问:一条视频可以同时讲活动和卖点吗?
可以但有主次。以活动为主时,卖点只挑一两个主力款带过,讲清参加活动的是什么就行;以卖点为主时,把活动作为收尾的利益点出现。两条主线都想讲透会超出屏数容量,结果是活动没讲清、卖点也没讲透,建议分开做两条。
问:生成后发现错别字或断行不对怎么改?
把屏次和问题直接描述给AI,例如第3屏的免字打错了、改成免费的免,或第2屏文字断在两行中间、请调整到一行。逐屏指正比整条重生成快,改完一屏确认一屏,全部确认后再导出。
问:批量做多条同类视频,画面会不会显得复制粘贴?
模板保证结构一致,画面差异来自素材和文案。批量前确认模板成片质量过关,别让一个有问题的模板被整批复制。同类视频批量时,每条的开场文案和首帧图单独换一换,观感就拉开了,结构统一反而显得专业。
问:怎么评估图文视频的实际效果?
按投放位看对应数据:活动视频看活动期间的进店和参与,卖点视频看详情转化和卖点咨询,社群内容看互动和转发。图文视频的价值是把信息快速讲清,数据改善体现在认知带来的转化上,与静态图版本做同周期对照最直观,别只看播放量。

评论列表 (0条):
加载更多评论 Loading...