你可以把AI视频生成想成做一本会动的连环画。生成一张图,相当于画一页。生成视频,相当于画几十页、几百页,还要让它们翻起来不穿帮。比如1秒视频按30帧算,就是30张图;5秒就是150张图。每一张图还不是一笔画成,而是像从一团雪花点里反复擦、反复改,改几十次才清晰。每一次修改都要让AI大模型算一遍。这样一乘,计算量就非常吓人。
而且视频不是简单的图片连播。AI还要记住人物长相、衣服、背景、动作方向,保证前后一致。否则就会闪、抖、变形。这就像画连环画时,每画一页都要回头看前面的画面,确认手没多一只、脸没变样。这个“回头看”和“对齐”也很耗算力。
另外,模型本身很大,参数很多。普通电脑的显卡内存小,算得慢,还会把数据搬来搬去。就算用云端GPU,也可能要排队。生成完以后,还要把这一堆画面压缩成mp4等视频格式,编码也要时间。
所以,AI视频生成慢,不是某一个原因造成的。它要生成很多帧,每帧要反复计算,帧与帧之间还要保持一致,再加上硬件和编码限制,自然比生成一张图慢很多。简单说,就是让一个画家画几十上百张不能穿帮的画,再快速翻成动画,当然快不了。 |
|