(以下内容从国金证券《互联网行业研究:视频生成模型专题深度系列(一)》研报附件原文摘录)
报告导读:
目前视频生成模型相比于LLM仍处于较早期阶段,技术范式尚未完全收敛,近期部分观点认为多模态能力更接近模型能力组件,而非推动智能能力上限提升的核心主线,但这均不影响多模态模型离商业化相对比较近。我们认为AI视频生成赛道仍有不错的商业模式,产业趋势持续向好,正处于商业化加速验证期。从技术端和产业端来看,AI视频生成赛道都迎来积极的边际变化:
1、技术端:7月31日,Seedance2.5正式发布,相较于2.0重点突破:单次生成时长提升至30秒;多模态参考素材提升至50个;精准编辑。模型进一步释放生产力,且应用场景扩充至具身智能、工业制造、汽车等行业。同日,Minimax发布全模态生成模型H3,支持对文本、图像、视频、声音组成的多模态上下文的统一理解能力、能够输出具备原生双声道的音视频。
2、产业端:1)短剧持续爆发:据中国网络视听协会,26Q1,新上线AI微短剧数量占比超95%。据DataEye,今年1月至5月AI剧/漫剧市场规模已突破220亿元,全年有望冲击400亿元。2)长剧/电影领域拓展:《太平年》中可灵AI深度参与部分虚拟场景及视觉特效镜头的创作。国内首部获得《网络剧片发行许可证》的全流程AIGC网络故事片《奇谭:纸刃渡荒墟》登陆爱奇艺,标志着中国AIGC影视从AI短片/概念片到AI商业长片的突破。
在技术不断迭代推动之下视频生成产业趋势持续向好,我们看好赛道商业化潜力爆发。后续核心关注及潜在催化包括:Seedance2.5实际效果、ARR转化;H3实际效果及商业化贡献;其他模型Kling等更新及ARR。
本系列将就以下问题做答:1)视频生成模型发展进程与技术迭代路线?技术瓶颈?2)以海外为鉴,Sora关停启示?3)核心玩家对比及自身迭代复盘?4)商业化变现途径?市场空间?5)竞争壁垒和格局?6)产业链玩家?
投资逻辑:
本篇报告将聚焦于前三个问题进行分析:
DiT为目前主流基础架构,但技术范式尚未完全收敛。视频生成模型经历了从以GAN/VAE为代表到Token化Transformer与Diffusion并行发展再到DiT规模化,已呈现出Scaling效应,但尚未迎来类似LLM的技术范式收敛时刻。下一阶段技术突破仅靠继续扩大模型规模、训练数据或许还不够,核心目标或将是推动模型从拟合表面规律走向学习可预测的动态关系,提升复杂场景下的物理合理性。
Sora是AI视频生成行业重要转折点之一,其关停表明模型能力突破并不必然转化成商业成功。Sora实现了生成时长突破;复杂提示词理解能力增强;时序一致性与画面稳定性明显提升;部分初步模拟能力。Sora今年全面关停,主要系,1)战略聚焦:OpenAI全力备战IPO,叠加应对Anthropic的竞争,将资源聚焦到Coding、企业服务等核心领域;2)商业模式未跑通:用户热度不持久,粘性低,收入和成本倒挂。3)版权增加约束。
从核心玩家对比来看,视频模型各有千秋和侧重。Seedance2.5更偏向“全模态长叙事与创作控制模型”,拥有最大规模的多模态参考数量、最长的单次生成时长和专业级精细编辑;Kling3.0系列更偏向“角色一致性与可控分镜模型”,优势在于分镜级精细控制和跨镜头主体一致性;H3更偏向“全模态理解与参考编辑模型”,核心优势在于跨模态素材理解,对生成、参考和编辑任务的统一支持;Veo3.1更偏向“高画质镜头生成与延展模型”,核心优势在于高质量短镜头、首尾帧控制和连续视频延展。
风险提示
技术发展不及预期;竞争加剧;商业化进程不及预期等。