第一次用AI做视频的人,通常很快会经历两个阶段。
开头是兴奋。人物会动,镜头会推,光影也像回事。多试几次以后,兴奋就被另一种感受取代:漂亮镜头攒了一堆,放进时间线却不像一条片子。这个人刚才还穿着黑衣,转个镜头领口变了;前一秒在下雨,下一秒地面是干的;画面单看都不错,连起来就是不对。
Seedance 2.5把单次生成上限从15秒拉到30秒,还能一次接收更多图片、视频和音频参考。7月底上线后,讨论几乎都围着“30秒直出”转。可用过视频模型的人知道,时长翻倍绝不只是多等一会儿。
15秒足够做一个动作、一段氛围、一次产品展示。30秒开始有了故事的最低形状:人得从一个状态走到另一个状态,动作要有起因,情绪要有落点。人物多走几步,模型需要记住的东西就成倍增加。
极客公园测试时写过一段咖啡馆场景:记者盯着空白文档,喝咖啡,开始敲字,窗外从暖黄变成深蓝,最后合上电脑。提示词不复杂,难点却都藏在过程里——手和杯子的关系、窗外光线的变化、敲键盘的节奏、人物表情从焦虑到放松。这些细节只要错两三处,观众就会出戏。
所以,Seedance 2.5带来的压力首先落在创作者身上。以前写一句“电影感、黄昏、慢推镜头”,抽到一条漂亮片段就可以收工;现在得先想清楚,30秒里究竟发生什么。
素材容量变大也有同样的问题。模型可以吞下更多参考图、视频和音频,但素材不会自动站成一队。哪张图负责人物,哪段视频只借运镜,音乐从哪里起,哪些参考彼此冲突,都得有人决定。输入框正在变回工作台。
这也是最近“智能拉片”“分镜管理”重新变热的原因。它们做的事情并不神秘:把一条成熟视频拆成镜头、运动和音乐,让创作者知道自己究竟在模仿什么,再把参考素材分配给对应环节。
生成视频走到这里,有点像早期数码摄影。相机越来越聪明,没有让构图和剪辑消失,只是让按下快门变便宜了。AI视频也是如此。模型负责把素材做出来,成片仍然要靠选择。
30秒还改变了团队内部的分工。短片段时代,最熟悉模型的人往往包办提示词、抽卡和初剪;镜头一长,前期脚本和资产管理重新有了分量。同一人物要准备哪些角度,服装和道具在哪些镜头必须延续,声音是模型直出还是后配,都需要在生成之前定下来。否则前面省下的拍摄时间,会在后面变成无休止的重抽。
这也是“50个参考素材”容易被误读的地方。容量说明模型允许带入多少信息,并不保证每一份信息都被同等理解。参考越多,互相打架的概率越高。创作者需要做的不是塞满额度,而是给素材排优先级:这一张锁定脸,那一段只参考动作,这一轨音频决定节奏。到了这里,提示词更像一份简化的拍摄计划。
版权问题也会跟着时长放大。一张相似的脸、一秒钟接近某部电影的构图,在碎片化传播里可能一闪而过;进入完整叙事后,角色、场景和音乐的来源都更容易被辨认。商业团队若打算把生成视频用于广告和剧集,仅有“模型可以生成”还不够,还要保存参考素材来源、授权范围和每次修改记录。
声音同样不能只看“是否同步生成”。对白有没有吞字,环境声会不会突然断掉,音乐是否压住人物,都要进入审核。画面能看以后,过去由录音、剪辑和混音解决的问题,会一项项回到流程里。
对商业团队来说,账还要算得更细。主角近景值得用高规格模型反复生成,一个半秒的街景过场未必需要。每一刀都上最贵的模型,成片未必更好,算力账单倒会先失控。30秒能不能用,不看官方演示有多惊艳,要看一个团队为了得到可交付版本返工多少次。
Seedance 2.5当然是一轮能力升级。它让人物一致性和连续表达向前走了一截,也让问题从“模型能不能画出来”变成“创作者知不知道自己要什么”。
一分钟、两分钟迟早会来。到那时,模型公司会继续讲时长,真正做片的人大概只关心三件事:这一条改几遍,花多少钱,观众愿不愿意看完。
*资料来源:字节相关产品公开信息;极客公园《Seedance 2.5实测》;InfoQ关于AI视频生产成本与工作流的报道。封面图源:极客公园。*