店铺上新和大促前,有一类视频需求量特别大:商品图片一页页切换,每页配一条大字卖点,讲完材质讲功能,最后收在价格和优惠上。这种把文字和图片组合成片的视频,就是图文视频。它不用真人出镜、不用复杂运镜,素材是现成的商品图,加一句句排版清楚的文案,就能快速成片。
图文视频最讨喜的地方是改得动。活动价变了,改一句文案重新生成,几分钟出一版新的;上新卖点调整了,换两条字幕就更新一版。对需要频繁换内容的上新和大促场景,这种”说改就改”的灵活性是实拍视频给不了的。卖家用它做上新预告、做详情讲解、做大促利益点轮播,成本低、产出快、覆盖广。
这篇文章把图文视频的制作过程完整走一遍:从写文案开始,到给文案配图、排版、排节奏,再到用青虎AI把文字图片生成视频。青虎AI是对话式AI电商作图工具,覆盖AI商品主图、AI图片处理、AI商品图一键生成视频、AI视频生成等场景,把写好的文案和商品图一起提供,描述想要的画面和排版,就能生成图文视频,支持批量。内容按真实制作顺序组织,照着一步步做,新手也能完成第一条像样的图文视频。
一、先弄明白:图文视频靠什么打动人
图文视频和实拍视频打动人靠的不是同一样东西。实拍视频靠画面说服,让买家看到商品真实的使用状态;图文视频靠信息说服,把商品的卖点和优惠用文字精确地摆到买家面前。它适合的正是”信息比画面重要”的场景。
判断一个内容适不适合做成图文视频,看三条:信息能不能用文字讲清楚,讲清楚后买家是不是更容易下单,改版的需求是不是很频繁。功能参数多的商品、价格利益点明确的活动、上新要快速传达卖点的链接,都是图文视频的用武之地。反过来,靠上身效果和氛围打动的商品,比如服装的实穿效果,图文视频只能做补充,主力还是实拍。
图文视频在店铺里的常规搭档是这样安排的:上新时出一条卖点轮播放详情首屏,大促前出一条利益点视频放活动位,日常用图文视频保底讲解,重要节点再用实拍视频增强。两类视频各管一段,店铺的内容既完整又经济。
二、开工第一件事:把文案写成结构稿
做图文视频最容易犯的错是急着找图、急着生成,文案随手写两句就开干。图文视频的骨架是文案,文案没立住,图和排版都白搭。写文案的方式不是对着图片憋词,而是先写一份结构稿,把这条视频要传达的信息分成几个层级。
定位句
一句话说清商品是什么、给谁用,放在开场,让买家十秒内建立认知。
核心卖点
三到五条,每条一句话,按买家的关心程度排序,是中段轮播的主体。
支撑信息
参数、材质、规格等能增加可信度的细节,做副标题或角标,不抢主卖点。
行动收尾
价格、优惠或查看详情的引导,放在最后一帧,推动买家下单动作。
拿一款保温杯举例,结构稿长这样:定位句写”一杯热水保温一整天的保温杯”;核心卖点写三条,保温12小时、316L内胆、一键弹盖单手喝;支撑信息放容量、重量、颜色;收尾写”现在下单立减20元”。结构稿定下来,后面每一帧放什么文案就有了答案。
结构稿的作用是防止想到哪写到哪。信息有了先后和主次,视频就有了逻辑,买家跟着顺序看下来,该知道的都知道,不会看完一头雾水。文案先成稿,也是后面用工具生成时最省返工的一步。
三、卖点文案怎么写:对着买家的疑问写
同一条卖点,写法不同,说服力完全不同。写卖点文案的窍门是把自己放进买家的位置,想象下单前会问什么问题,然后让文案来回答。
| 买家心里在问什么 | 卖点文案怎么写 | 示例 |
|---|---|---|
| 这东西是什么、适合谁 | 用一句带场景的话点明定位 | 通勤族的随手保温杯 |
| 最核心的好处能不能兑现 | 用具体数字和结果说话 | 早上装的热水,下班还是烫的 |
| 凭什么信你 | 亮材质、工艺、检测等事实 | 内胆316L医用级不锈钢 |
| 用起来方不方便 | 描述使用动作和体验 | 一键弹盖,单手就能喝 |
| 现在买划不划算 | 价格、优惠、赠品放最后 | 到手价89,前100名送杯刷 |
写卖点文案记住三个原则。一是用结果不用形容,说”保温12小时”比说”保温效果很好”有力;二是用短句不用长句,买家扫一帧画面只有一两秒,短句才读得完;三是说人话不用术语,买家理解”不锈钢内胆”比理解一串材质代号快得多。
文案写好后做一轮减法:删掉修饰词,删掉图片上已经看得见的内容,删掉大多数买家不关心的参数。删完剩下的,才是这一帧真正要传达的信息。文案的质量不在多,在于每条都打在买家的疑问上。
四、文字和图片怎么分工:一帧只讲一件事
图文视频画面乱,通常是因为文字和图片在抢着说话。给它们分好工,画面就清爽了:图片负责让买家看清商品长什么样,文字负责告诉买家它好在哪。图片能展示的,文字不重复;文字要强调的,图片让出空间。
分工的具体做法是给每一帧定一个主角。这一帧想讲保温,画面就给杯身特写,文字就是保温那条卖点;这一帧想讲容量,画面就给杯子和参照物的对比,文字写容量数字。一帧只有一个主角,买家看的时候不用在文字和图片之间来回找重点。
判断画面有没有超载,把视频暂停在任意一帧:这一帧的信息点超过两个,比如图上压着三行字、背景还有一堆道具,就要砍。砍的原则是先保主角:文字是主角的帧,图片换成干净的大图;图片是主角的帧,文字只留一句点睛。帧和帧之间这样轮换,整条视频既有看的也有读的,节奏不单调。
五、文字排版守住五条硬规则
图文视频里文字是主角,排版的质量直接决定这条视频专不专业。排版不靠天赋,靠规则。下面五条规则每条都能检查,照着做就不会出大错。
| 规则 | 怎么做 | 怎么检查 |
|---|---|---|
| 字号分层级 | 主标题最大,副标题次之,角标最小 | 缩小画面,主标题依然一眼可见 |
| 一屏一条主信息 | 主标题只放一句,参数放副行 | 每帧口头念一遍,能一口气念完 |
| 文字落在安全区 | 四周留边,避开屏幕边缘和底部区域 | 文字没有贴边,没有被裁掉的隐患 |
| 和背景拉开对比 | 浅底配深字,深底配浅字,必要时加深色底条 | 暗处截图看文字是否清晰可读 |
| 强调色只给重点 | 价格、核心数字用强调色,其余用中性色 | 全片强调色不超过一两种 |
字号层级是排版的骨架。主标题和副标题的字号差要拉得开,视觉对比清晰,买家扫一眼就知道先读哪句;所有文字一般大,画面就没有焦点,信息全靠硬读。字数控制住,主标题别超过十个字,一句能念完;一帧的总文字量别超过两三行,多了就读不进去。
安全区常被忽略却最影响观感。手机端浏览时,画面边缘和底部会被界面元素遮挡,重要文字放中间偏上的区域更保险。文字也不要压住商品的关键部位,杯子的Logo、衣服的领口、包装的品名都是禁区。排版完把画面缩小看一遍,文字和商品谁也没压谁,就基本到位了。
一帧排版自检
把这一帧缩小到手机屏幕大小看一眼:主标题读得清吗?文字压住商品了吗?画面里有没有超过两个信息点?三问都过关,这一帧就立住了。
六、卖点轮播的节奏:给文字留足阅读时间
卖点轮播是图文视频里最常用的一种,结构不复杂,难点在节奏。画面切得太快,字还没读完就换了;切得太慢,买家等得不耐烦划走。节奏要跟着文字量走。
| 时间段 | 放什么 | 文字安排 |
|---|---|---|
| 开场两三秒 | 商品整体图,定位句 | 一句定位语,大字居中,让买家知道这是什么 |
| 中段每个卖点三四秒 | 卖点对应的图片逐张切 | 每帧一条主卖点,副行补一个关键参数 |
| 收尾两秒 | 商品收束图 | 价格或查看详情,推动最后一步 |
卖点轮播的总时长和卖点条数挂钩。三到五条卖点,每条给足阅读时间,整条视频做到12到20秒是常见区间。卖点超过五条就精简合并,别让次要卖点稀释重点;四条以内的卖点也不硬凑时长,讲完即收。
帧与帧之间的衔接保持统一的版式习惯:主标题固定放在同一区域、字号一致,换的是图片和文字内容。版式统一让买家看着连贯,画面变化集中在信息和图片上,而不是每帧重新找一遍文字位置。
节奏检验方法
把做好的视频正常速度看一遍,能复述出定位句和两三条卖点,说明节奏合适;看完啥也记不住,多半是切得太快或信息太挤。再静音看一遍,字幕能独立讲清卖点,就说明节奏稳了。

图1:图文视频的制作流程,文案和排版先行,生成只是最后一步
七、用青虎AI把文字图片生成视频:三步出片
文案和版式定好后进入生成。过去做一条图文视频,要在剪辑软件里逐帧摆文字、调动画,改一版文案要重做一遍;对话式AI工具把这一步收拢成三步,把图片、文案和排版要求说清楚,视频就出来了,改版也在对话里完成。
生成前的准备决定成片质量:图片挑主体清晰、背景干净、留得出文字空间的;文案按结构稿整理好,一条卖点对应一段话,标明哪句是主标题、哪句是副标题。准备得越整齐,描述起来越省事,成片越接近预期。
步骤一:上传图片和文案,描述画面安排
把商品图和文案结构稿一起提供给青虎AI,说明用途和画面要求:把这三张收纳箱图片和文案做成一条图文视频,放详情页用,时长15秒左右,第一张图放定位句,后三张各配一条卖点,文字排版清晰不遮商品,最后一张放价格。初版出来先看结构和文字是否完整。
步骤二:逐帧调版式,定下样板
初版里的字号、位置、颜色不合适的地方,用一句话指出让AI调整:主标题统一放大放画面左上方,副标题缩小放下方,价格数字用红色放大放最后一张,文字全部落在安全区内不压商品。逐项调到满意,这条样板就是整批的标准。
步骤三:样板套用,批量生成多版
样板确认后,其他商品或同款多版本按这套版式批量生成:按刚才这条视频的版式和节奏,把我上传的其他商品图与对应文案生成同样的图文视频。大促要出多版文案时,把每版文案分别提供,一套图片批量出多条,逐条检查错字和文字越界后导出。

图2:同样一张图,排上结构化的文字后,信息立刻清楚可读
生成结果的验收按三层来。先看文字层:有没有错别字、层级清不清楚、每屏文字量有没有超载;再看画面层:文字有没有遮挡商品、各帧版式统不统一;最后看整体:轮播节奏顺不顺、卖点顺序对不对。三层过完,成片就能上架。

图3:青虎AI对话式生成图文视频,提供文案和图片即可批量出片
八、不同位置怎么用图文视频
同一条图文视频,放在不同位置,要求差别不小。图文视频产出快,正好适合按位置做适配,而不是一条视频硬放所有地方。
放主图位,文案要极简:主图视频的观看场景是快速滑动,买家不会停下来细读,只放一句最核心的卖点加定位,字大、节奏快、前两三秒信息完整。放详情首屏,可以完整轮播:买家已经对商品有兴趣,愿意花时间看,卖点按决策顺序一条条讲透。放活动承接位,文字主角换成价格和优惠:券额、折扣、时间用大字突出,氛围靠底色和强调色立起来。
同一个商品要覆盖多个位置时,图片素材共用,按位置换文案重排:主图版砍到一句话,详情版保留完整轮播,活动版把价格提前放大。改版的重心放在文字层,图不用换,用青虎AI批量出多版的速度跟得上这种频繁换版的需求。
九、做图文视频常见的四个误区
图文视频看着门槛低,做起来误区不少,下面四个是卖家最容易踩的。
误区一:把图和字堆在一起就算图文视频
图文视频的内核是信息结构。没有定位句、没有卖点顺序、没有行动收尾,图和字堆得再多,买家看完也记不住重点。先写结构稿再动手,是图文视频和”PPT式拼图”的分界线。
误区二:文案写详细点,买家才看得明白
买家读视频里的文字只有一两秒,文案越密,读进去的越少。一帧只放一条主信息,参数挑最关键的放副行,其余留给详情文字。视频文案是筛出来的,不是罗列出来的。
误区三:每一帧都图文并茂才算完整
帧和帧之间要有节奏变化,不能每帧都是大图加大字。有的帧让图片当主角,文字只点睛;有的帧让文字当主角,图片退成干净的底。全是满配画面,视觉会疲劳,反而没有重点。
误区四:一条视频做出来,全店全位置通用
主图、详情、活动位的观看场景不同,一条视频硬放所有地方,要么字太小读不清,要么节奏不对没人看完。图文视频的优势就是改版快,按位置各出一版,成本不高,效果差异却很大。
四个误区指向同一个核心:图文视频拼的是信息设计,不是拼图。结构、文案、排版每一样都有规则,规则守住,工具才能把设计快速执行出来。
十、让图文视频做得又快又好的四个技巧
绕开误区之后,给四个能直接提升图文视频产出质量和速度的技巧。
技巧一:文案先写全再删狠
动笔时把想说的都写下来,写成完整长句,再按帧删减:删修饰词、删图片上看得见的内容、删无关参数,删到每帧只剩一句核心。先全后删比直接憋短句顺畅,删出来的文案也更经得起推敲。
技巧二:版式定一套,内容随便换
把文字位置、字号层级、强调色这套版式固定下来,所有图文视频共用。换商品、换文案、换活动,版式不动。版式统一让整店视频有识别度,新商品上手也快。
技巧三:活动片按节点预做,不临时赶工
大促的活动规则一确认就开始做文案,按预热、爆发、返场备好几版。节点一到直接换版投放,不用当天赶素材。图文视频产得快,更要提前用在排期上。
技巧四:描述沉淀成固定话术
放详情、放主图、放活动位这几类需求的处理描述固定下来。用青虎AI生成时直接套话术,只换图片和文案,出片风格稳定,也省去每次组织语言的功夫。
四个技巧分别落在文案、版式、排期和话术上,核心都是把一次性的制作沉淀成可复用的流程。流程固定了,图文视频的产出就稳定了。
十一、三个图文视频制作的实际场景
看三个把制作流程完整跑起来的场景,覆盖图文视频最常见的需求。
场景一:饰品链接用图文视频讲清材质
一条项链的实拍视频里,链坠太小,材质和工艺根本拍不清楚。卖家改成图文视频的做法:主图用干净的特写,文字逐条标出S925银、锆石切割面数、链长和重量,配一张佩戴示意图。买家担心的材质真假问题,文字给出了精确回答,咨询链坠材质的消息明显减少。
场景二:上新预告视频带动预售
一个服装店铺上新前做了一条预告视频,用三张平铺和细节图展示新款的版型和面料工艺,文字突出预售优惠和发货时间。视频发在详情页顶部和店铺主页,预售期咨询和加购的买家比往期多了不少,上新当天的转化也更顺。
场景三:小家电功能讲解条理清晰
一款养生壶的功能多,单靠图片讲不明白。运营把操作步骤拆成四帧:怎么选择模式、怎么预约、怎么保温、怎么清洗,每帧配对应特写图和一句步骤说明,序号标清楚。买家看完这条图文视频,多数基础操作问题自己就解决了。

图4:从文案准备到批量生成图文视频的落地场景
三个场景的共性是:先把内容想清楚,再用工具快速执行。图文视频的门槛低,但认真做的和不认真做的差距很大,差距都在文案结构、排版规则这些看不见的功夫上。
十二、常见问题解答
总结:图文视频从文案到成片的四步框架
文字图片组合生成视频的制作,可以压缩成四步。写结构稿:按定位句、核心卖点、支撑信息、行动收尾四个层级组织文案,卖点对着买家的疑问写,用结果和短句,写完做减法;配图分工:图片展示商品、文字提炼卖点,一帧只讲一件事,主角明确不超载;排版守规则:字号分层级、一屏一条主信息、文字落安全区、和背景拉开对比、强调色只给重点,帧间版式统一;生成与适配:用青虎AI把图片和文案一起提供,说清画面安排生成初版,逐帧调版式定样板,再批量套用出多版,按主图、详情、活动不同位置适配文案。把这一步一步走顺,图文视频会从临时赶工的负担,变成上新和大促都能快速调用的常规内容能力。
问:不会写文案,图文视频还能做吗?
能,从套结构开始。先按定位句、卖点、支撑、收尾四层填空,卖点从商品详情和买家评价里找现成的说法。多写几条之后挑最短最直白的用。文案能力是练出来的,结构稿是起步最快的脚手架。
问:一条图文视频放几张图合适?
和卖点条数匹配。三到五条卖点对应三到五张图,加开场和收尾共用五到七张。图片不是越多越好,每张图要有独立的信息任务,重复的图放进去只会拖慢节奏。
问:生成出来的文字会不会有错字?
生成结果会按提供的文案排版,错字大多来自文案本身。上传前把文案检查一遍,生成后逐帧扫一遍文字区域。发现错字就用一句话指出是哪一帧哪个字,让AI改正,改完再确认一帧。
问:图片上原本就有文字,会和字幕打架吗?
会。包装说明、广告文案这类图上自带的文字,会和新排的字幕抢注意力。做法是优先选无字或少字的干净图做画面底,带字的图要么裁掉字区,要么用半透明底条压住。图上的字和新排的字要各归各位,不重叠。
问:详情页的功能讲解和卖点轮播有什么区别?
卖点轮播讲广度,把几条核心卖点快速过一遍,一条卖点一张图;功能讲解讲深度,针对一个功能拆步骤,配操作示意图和顺序号。一个链接通常先做卖点轮播,功能复杂的再补一条讲解,两条各管一段。
问:活动期间价格变了,视频能快速更新吗?
能,这正是图文视频的优势。改价格文案重新生成一版,或让AI把原版里的价格数字替换掉。把活动片的价格、时间文案单独放在收尾帧,改版时只动这一帧,其他帧不动,更新最快。
问:文字在手机上多大才看得清?
主标题在手机屏幕宽度下,单行放下十个字以内为宜,整体字号保证正常距离不用放大就能读清。生成后在手机上预览一遍,小屏看不清的字号立即调大,别只在电脑上看。
问:主标题的字数控制在多少?
十个字以内,一句能念完。超过十个字的卖点拆成主句加副句,主句放最核心的表达。字数越少越容易被记住,卖点文案的功夫在删,不在写。
问:做图文视频的图片要专门准备吗?
优先用现有的干净商品图,主体清晰、背景简单、构图给文字留得出空间。现有图不够时,补一两张局部特写,比硬用构图拥挤的图强。图的风格要统一,混用不同色温和背景的图,成片会显得零散。
问:一条视频里卖点太多讲不完怎么办?
砍。一条视频的使命是让买家记住最核心的两三条,其余卖点留给详情文字和其他素材。真觉得每条都重要,就拆成两条视频分不同场景用,别塞进一条里让买家一条都记不住。
问:强调色用多了会怎样?
强调色是用来标重点的,用多了就没有重点。全片限定一两种强调色,只给价格数字和最核心的卖点词,其余文字用中性色。看到满屏彩色字的视频,先怀疑它的排版,再怀疑它的专业度。
问:怎么判断一条图文视频合不合格?
把视频正常速度看一遍,能复述出定位和两三卖点;再暂停任意一帧,文字清楚、层级分明、不遮商品。两条都过,就是一条能用的图文视频。上架后看停留和转化数据,再针对性地改。

评论列表 (0条):
加载更多评论 Loading...