站内精选
核心结论:用AI把古诗词做成动画短视频,怎么做?实测结论:核心方法是“DeepSeek拆解意象+即梦生成画面+可灵让画面动起来”,三者配合,一首诗从文案到成片大约需要2-4小时。下面是我的完整实操步骤、效率方法和避坑经验,希望对想尝试的人有帮助。

为什么古诗词动画看起来很美,自己一上手就废?

把“枯藤老树昏鸦,小桥流水人家”转化成画面,难的不是写提示词,而是意境还原。我在一开始尝试时发现,AI能画出好看的山水,但画不出“断肠人在天涯”的孤寂感。诗词的字面意思容易翻译,真正难的是把意象之间的情绪张力转译成视觉语言。

绝大多数人卡住的三个问题:画面风格不统一(第一张像水墨,第二张像年画)、人物动态僵硬(衣纹不动,表情呆滞)、转场节奏和诗词朗读对不上。这些问题不是单个工具能解决的,关键在流程设计。

核心方法:全流程拆解,三个工具各管一段

我摸索出的方法是:DeepSeek负责理解和分镜,即梦负责画面生成,可灵负责动态化。以下是我反复调整后觉得最容易出效果的四条路线:

延伸阅读:AI国风诗词动画创作课:巧用Deepseek即梦可灵,打造意境十足的诗词影像短片

  1. 先让DeepSeek做“意象拆解表”。不用让它直接写提示词,而是先输出:这首诗有几个核心意象、每个意象的视觉属性(色彩/构图/光线)、情绪基调是什么。比如“月落乌啼霜满天”,关键不是月亮乌鸦,而是冷色调、大面积留白、雾气质感
  2. 用即梦的文生图功能逐句出画面。每次只生成一个完整的画面描述——主体、环境、光影、氛围、画风参考,全部写清楚。画风建议锁定水墨淡彩或青绿山水,统一性比“好看”更重要。
  3. 用可灵图生视频做动态化。把即梦生成的高质量静图导入可灵,提示词里只写动态描述,比如“雾气缓缓流动,江水波纹细碎,树枝被风吹动”,不要写任何跟画面内容重复的静态描述,这是关键。
  4. 最后用剪辑软件拼装。每句诗词对应的镜头控制在3-5秒,配上朗读和背景音乐,转场用淡入淡出,比花哨的转场效果更有古诗词的留白感。

我个人的血泪经验是:如果一张图在你的审美标准里都过不了关,不要指望让它“动起来”之后会变好看。动态化不能修复静态画面的缺陷,它只会放大。

实操步骤:从一首五言绝句到完整短片

我用《静夜思》做过完整测试,把每一步的关键参数和提示词写法拆开讲,按这个流程基本不会跑偏。

第一步:用DeepSeek生成分镜脚本(约20分钟)。我给的提示词模板是:“请分析《静夜思》的视觉呈现,输出一份4个镜头的分镜脚本,每个镜头包含:画面内容、色彩倾向、光线方向、情绪关键词。要求体现‘举头’‘低头’两个动作的镜头衔接逻辑。”它输出的结果里,“低头的剪影要占据画面下三分之一,上方留出大面积夜空”这个建议很关键。

第二步:用即梦生成静态画面(约40分钟-1小时)。即梦适合用文生图而非图生图来从头创作。我的提示词结构是:古风水墨画风格+主体描述+环境描述+留白要求。比如“窗前人影侧面剪影,低头沉思,窗外一轮明月,地面银白色月光,大面积留白,宣纸纹理,淡墨色为主”。最关键的一步是锁定“种子”参数,或者用同样的提示词套模板生成系列图,保证4张图风格统一。

第三步:用可灵做图生视频(约1小时)。把即梦出图导入可灵,动态提示词只写“月光在云层中缓慢移动,人物衣角轻微浮动,画面有轻微呼吸感”这类光影与氛围变化。我测试下来,可灵对烟雾、水纹、光照变化的处理很细腻,但人物转身、走路等大动作容易变形,能避开就避开

第四步:剪辑合成(约30分钟)。每句诗对应一个镜头,时长卡在朗读节奏上。配乐选择古琴或箫声,音量压到朗读音量的一半以下。字幕用楷体或宋体,白字加半透明黑底,防止浅色画面里看不清。

避坑点:四个新手容易犯的错误

以下问题是我在测试中反复踩过、周围朋友也问得最多的,值得专门写出来。

  1. 不要用人物特写镜头。AI生成的人物脸部细节在动态化时容易崩掉,眼睛和嘴角会产生类似“恐怖谷”的不自然扭曲。我的方法是多用远景、剪影、背影,或用道具遮面,既藏拙又更有意境。
  2. 不要用竖屏生成视频再裁成横屏。可灵和即梦的画面比例需要预先统一,后期硬裁会损失大量关键构图——尤其竖构图的水墨画,裁完就只剩半棵树了。我一般直接选16:9生成,方便视频平台的横屏展示。
  3. 不要连续生成多个相似镜头再挑。否则会发现每次生成的人、物各不相同,连山峦的起伏形态都对不上。正确的做法是用同一张静图多次生成动态视频,选最满意的那一次动态。
  4. 不要忽略诗词朗读的节奏。很多人在配乐和音效上花了很多功夫,却忘了朗读本身才是诗词的骨架。我用剪辑软件把朗读的每个字对齐到画面切换的关键帧上,效果立刻拉开一个档次。

一句话总结这种方法的使用边界

这套“DeepSeek理解叙事+即梦定基调+可灵动起来”的方法,适合什么场景、需要多久?我实测下来比较适合短小精炼的绝句和律诗,大概20-40字的体量;篇幅太长(超过8句)会导致分镜管理和风格统一难度飙升。从零基础到独立做完一条30秒短片,普通人的学习成本大约需要一周左右,每天投入两小时,熟悉三个工具的界面逻辑和常见参数之后,制作速度会明显提升。如果是电脑配置较低的创作用户,即梦和可灵都有网页版,手机端也能操作,但对画质和细节调整的精细程度会比电脑端差一些。

对零基础的人来说,最大的隐形门槛不是工具操作,而是感知:你能不能看出“这幅图不够好,缺的是层次”,以及“这个镜头动起来不对,问题出在静态阶段”。这种画面审美能力比任何技术细节都重要。

最后的感悟

使用AI做诗词动画,最让我惊喜的部分不是效率,而是它能让你重新理解一首诗。当我在深夜调试“帘外雨潺潺”的雨丝密度时,第一次感受到了“春意阑珊”的重量。这已经不是简单的工具使用表面体验,而是一次别样的诗词生活记录。想试的人不用等到把所有功能都准备好——选一首你最熟悉的诗,按上面的流程走一遍,两小时之内你会看到第一版成品,那种心情,是任何教程都无法替代的。

你心中最想试着做成动画的那首诗词是哪一首?不妨在评论区留下诗名,我会用这套流程测试,并将经验分享回来。

本文更新于 2026-08-14,内容基于实际经验整理。

常见问题解答

AI古诗词动画小白要学多久?

我自己的经验是每天花两小时,一周以内可以独立走完从文案分析到成片输出的完整过程。第一首做出来差不多花6-8小时,做到第三首开始能压缩到2-3小时,前提是三个工具的基础操作需要提前熟悉一下。

完全不懂AI绘画的人能做吗?

能,而且这恰好是一件“懂诗意比懂AI更重要”的事情。三个工具里,即梦和可灵的操作界面都偏小白友好,输入自然语言描述就能出结果,不需要懂任何代码或底层技术。关键是画面审美和诗词感受力。

做好的诗词动画能直接发布到短视频平台吗?

可以。我的通常做法是输出16:9横屏版本,适合B站和小红书,配上清晰字幕和朗读字幕。另外提醒一句,如果计划公开发布,注意选用已经过版权期的古诗词作品,以及平台对这些内容的规定,避免不必要的麻烦。

即梦和可灵的区别是什么?两个都必须用吗?

即梦擅长做静态图片的个性化风格控制,尤其在中式美学画风上有很大优势;可灵擅长让图片动起来,动态细节丰富自然。它俩是上游和下游的关系——先出好图,再合成视频,所以都需要。


你可能还想看

发表回复

后才能评论