20.1 C
Changsha
2025 年 10 月 27 日 15 时 39 分 19 秒
前沿科技

美团发布 LongCat-Video 视频生成模型,支持 5 分钟级连贯输出

文章来源:techweb

【旭才科技】10 月 27 日消息,美团 LongCat 团队正式发布 LongCat-Video 视频生成模型,该模型支持文生视频、图生视频及视频续写。美团强调,LongCat-Video 可稳定输出 5 分钟级别的长视频,且无质量损失。

据介绍,在文生视频方面, LongCat-Video 可生成 720p、30fps 高清视频,能精准解析文本中物体、人物、场景、风格等细节指令,语义理解与视觉呈现能力达开源 SOTA 级别。

图生视频, LongCat-Video 严格保留参考图像的主体属性、背景关系与整体风格,动态过程符合物理规律,支持详细指令、简洁描述、空指令等多类型输入,内容一致性与动态自然度表现优异。

视频续写是 LongCat Video 的核心差异化能力,可基于多帧条件帧续接视频内容,为长视频生成提供原生技术支撑。

另外,依托视频续写任务预训练、Block-Causual Attention 机制和 GRPO 后训练,LongCat-Video 可稳定输出 5 分钟级别的长视频。

模型结合块稀疏注意力 (BSA) 与条件 token 缓存机制,大幅降低长视频推理冗余 —— 即便处理 93 帧及以上长序列,仍能兼顾效率与生成质量稳定,打破长视频生成 「时长与质量不可兼得」 的瓶颈。

美团发布的数据显示,通过全面的评估显示,LongCat-Video 通用性能优秀,综合能力跻身开源 SOTA:

136 亿参数的视频生成基座模型,在文生视频、图生视频两大核心任务中,综合性能均达到当前开源领域 SOTA 级别;

通过文本-视频对齐、视觉质量、运动质量、整体质量四大维度评估,其性能在文本对齐度、运动连贯性等关键指标上展现显著优势;

在 VBench 等公开基准测试中,LongCat-Video 在参评模型中整体表现优异。