实测Seedance2.5:更长、更稳,细节还不到位。

AIX财经(AIXcaijing)原创

作者 | 雷晶

编辑 | 金玙璠

7月31日,Seedance 2.5来了。

这次升级的核心参数变化是:单次生成视频时长从15秒拉到30秒原生直出,并支持多轮延长;单次生成最多可参考50个素材,涵盖图片、视频、音频三种模态;强化了视频局部编辑的能力,支持局部细节修改、元素增减,时间戳指令的精度可控制在1秒以内;支持直接参考绿幕和白模素材生成,并可通过Maya、Blender插件调用;覆盖十余种语言,口型与语速也能同步匹配。

从升级方向看,字节想把Seedance模型能力再往上提一档,推向影视、广告、游戏等更专业的生产场景。

2月7日,Seedance 2.0开启内测,在社交媒体上引发大量讨论,不少用户给出正面反馈。但热度退去后,问题也逐渐暴露:人物皮肤有蜡质油腻感,表情夸张、AI味明显,角色长得千人一面。

那么,Seedance2.5到底好不好用?我们通过即梦AI试用了Seedance2.5,给它设置了六个任务进行实测,覆盖单人长视频、多人打斗、多模态素材集成等场景。

先说感受。Seedance 2.5的真实感有了明显提升,人物面部的蜡质感有所减轻,皮肤纹理更接近真实质感,表情也不再像过去那样用力过猛。

提示词的长短也会直接影响使用体验。提示词越长、细节越多,生成速度往往越慢,也更容易触发审核拦截;提示词简短,生成速度明显更快,审核通过率也更高。

一次出片的稳定性同样有所提升。相比过去动辄需要反复“抽卡”才能得到一条可用的视频,Seedance 2.5的可控度确实更高。大多数场景下,生成一到两次就能拿到质量过关的结果。

接下来,我们具体看看它的实际表现。

01.单人视频:肤质提升,也更会表演了

这一轮考验的是Seedance 2.5最基础、也是最核心的一项升级:30秒原生直出能力,以及人物在视频中的表演质量。

我们设定了一个车站告别的场景,要求展现一场离别,人物需要传达不舍和隐忍克制的情绪。这类静态情绪表演,其实很考验模型。信息几乎全靠面部微表情传达,皮肤质感、眼眶的微红、嘴角的细微抿动,任何一个细节失真,都会让观众迅速出戏。

测试中先出现了一个插曲。提示词第一次提交时被审核驳回,但内容并不涉及明显的敏感因素。类似情况在后续场景中也有出现,我们删减措辞后才顺利通过。对于需要精细描述人物状态、镜头语言和场景氛围的创作者来说,这种审核拦截会影响创作节奏。

成片出来后,质量确实过关。最直观的进步体现在皮肤质感上。Seedance 2.0被频繁吐槽的蜡质感和油腻感,在Seedance2.5的视频中明显减轻。车站的灯光落在人物脸上,肤色呈现出较为自然的明暗变化,毛孔和皮肤纹理也更接近真人。

人物的情绪表达同样有所进步。Seedance 2.0时期常见的瞪眼、皱眉等用力过猛的表演没有出现,人物的不舍主要通过眼神和细微表情传递,整体基本符合提示词要求的隐忍克制。

比真人感更值得关注的是,Seedance 2.5在30秒内维持住了人物外貌、场景光线和情绪状态。过去生成较长内容,通常需要将多个短片段分别生成后再进行拼接,人物换脸、光线跳变、情绪重置等问题往往就出现在片段之间,30秒原生直出减少了跨段生成和后期修补的成本。至少在单人物、低强度动作的场景下,时长翻倍没有带来明显的稳定性下降,这才是这项升级更实际的价值。

02.多人视频:角色没有变脸,动作也很流畅

单人表演过关,接下来加一个人。

我们设定了一个双人对峙的场景,故事发生在北宋,红衣剑客与黑衣刀客狭路相逢,随后展开打斗。这个场景考验的核心有两个:一是角色一致性,镜头切换之后,两人的衣着、面容和武器不能发生变化;二是人物动作交互的合理性,刀剑碰撞时不能穿模,肢体动作也不能出现不符合物理规律的情况。

提示词对运镜、场景、光影和人物设定都作了比较详细的描述,篇幅也相对较长。第一次提交再次被审核驳回,删减和调整措辞后才顺利通过。

生成的视频基本符合要求。两位主角在多个镜头之间保持了较好的一致性,皮肤质感同样更接近真人。对峙时的紧张感主要通过眼神和细微表情传递,没有依靠怒目圆睁等脸谱化动作来强调情绪。打斗整体流畅,没有出现明显的卡顿、定格或动作停滞。

这轮测试说明,在多人物场景中,Seedance 2.5能够同时兼顾角色一致性和动作合理性,人物没有随着镜头切换而“变脸”,打斗也没有因为复杂交互而失控。

03.视频延长:画面接上了,剧情衔接不到位

Seedance 2.5可以在已有视频的基础上继续延长,于是我们选择了上一轮生成的双人打斗视频,要求模型向后延长10秒,在继续推进剧情的同时,保持人物外貌、画面风格和叙事节奏的一致。

视频延长考验的不只是模型能否继续生成画面,还要看它能否理解前一段视频的剧情进度和情绪状态。

成片的问题比较明显,原视频结尾停在两人背对背、相隔数步的位置,延长部分却没有顺势推进新的动作,而是让这一静止状态停留了过长时间,导致衔接处的节奏明显断了一拍。随后虽然出现了新的打斗,但与前面的紧张对峙缺少情绪和动作上的过渡,更像是在原视频后面拼接了一段新内容。

视觉上的延续做得相对更好。两名角色的外貌、服装配色和武器基本保持一致,画面风格也没有发生明显变化。

视频延长包含两个层面的连续性:一是人物、场景和风格的视觉连续,二是动作、情绪和因果关系的叙事连续。这一轮可以看出,Seedance 2.5基本做到了前者,但没有处理好后者。它能够识别前一段视频“长什么样”,却还不能完全理解剧情“讲到哪里”。

04.白模参考:空间还原准确,利好游戏影视制作

这一轮测试的是Seedance 2.5新增的一项能力,以白模视频为参考生成成片。

简单来说,白模是一段只有基础几何结构、没有材质和光影的3D预演视频。Seedance 2.5要做的是保留原有的空间结构、物体位置,再为画面补充材质、灯光和环境细节,将其转化为一段视频。

这项能力解决的是提示词难以精确描述空间关系的问题。相比反复告诉模型运镜和方位,创作者可以直接通过白模确定物体位置和镜头走位,再让模型根据要求的视觉风格生成相应的视频。

我们上传了一段城市场景的白模预演视频,要求Seedance 2.5基于此生成一个“废墟感”的视频,展现一座经历灾难后的未来科幻城市。原始白模只有建筑体块和道路轮廓,环境氛围及画面细节都需要模型自行补全。

成片的空间还原度不错,建筑之间的位置关系基本得到保留,没有出现明显的楼体错位或透视穿帮。Seedance 2.5为建筑补上了“废墟感”,画面色调灰暗,楼体能看出破旧的质感。

对于游戏和影视的前期制作来说,这项能力更有价值。无论是关卡场景、分镜预演,还是广告镜头提案,创作者都可以先用白模确定空间和运镜,再快速生成视觉预览,用于验证镜头效果和整体风格。

05.多模态参考:容纳的素材更多了,但理解还不够准

Seedance 2.5扩大了单次生成可参考的素材数量,最多可以承载50个素材,覆盖图片、视频和音频三种模态。

50个是不同类型素材相加后的上限。具体来看,图片最多支持30张,分辨率不超过4K,单张不超过30MB;视频最多10个,单个不超过200MB、时长不超过30秒,所有视频总时长不超过30秒;音频最多10个,单个不超过15MB、时长不超过30秒,所有音频总时长同样不能超过30秒。这样来看,即便数量上很多,实际受到不少限制。

既然要测试它的多模态素材集成的能力,我们就把强度拉满。我们给seedance2.5提供30张图片和总时长30秒的视频、音频来生成一个饮料广告的视频。

这一轮主要考察模型能否同时理解不同素材的作用,我们让它从图片中提取画风和产品,从视频中参考场景与镜头,再给出了背景音频。

成片基本符合要求,画面延续了参考图片的插画风格,场景和镜头也基本贴合参考视频。不过,素材之间出现了错位,画面采摘的水果是柠檬,最后出来的产品是橙汁。

这说明Seedance 2.5能够从大量素材中提取画风和场景特征,但对不同素材之间的关系还没有完全理顺。参考素材变多之后,还不能完全准确判断每份素材对应的要求。

06.产业场景:有广告质感,工业精度还不够

前面几轮测试主要集中在创意内容生成,但Seedance 2.5这次强调向更专业的产业场景延伸。最后一轮,我们来测试它的产业视频生成和局部编辑能力。

我们上传了一张工业机械臂的图片,要求Seedance 2.5基于图片生成一段机械臂抓取物品的视频。

成片整体还原了要求,机械臂关节转动和抓取动作基本符合要求,但画面仍然带有一定的“AI味”,更像是工业产品广告,而不是工厂现场的实拍。此外,视频开头还出现了一段提示词没有要求的钢笔特写,显得比较突兀。

随后,我们对原视频进行了局部编辑,要求模型将钢笔替换为手机。它修改的速度比较快,原视频中的其他画面没有改动。局部编辑的功能对创作者来说比较有价值,不必因为一个细节出错就重新生成整条视频。

从这次测试来看,Seedance 2.5已经能够生成具有工业题材质感的视觉内容,并完成基础的局部修改。但以目前的表现来看,它更适合工业产品展示、方案演示和营销内容,还不能据此判断其能够直接用于工业仿真或生产数据生成。

07.结语

六个场景测下来可以看出,Seedance 2.5人物真实感有所提升,30秒原生直出能够维持基本的画面和表演状态,双人物场景中的外貌一致性与动作交互也更加稳定。白模参考和局部编辑,则让创作者有了进一步控制空间与修改画面的方式。

问题主要集中在使用体验上,提示词审核不够稳定,视频延长能够延续人物和画风,却没有处理好剧情节奏;多模态参考生成视频对素材的理解还有待提升。

回到文章开头的问题,Seedance 2.5确实解决了Seedance 2.0留下的部分问题。它延续了Seedance 2.0已经得到验证的画面生成能力,并将升级重点放在时长、稳定性、参考输入和视频编辑上。模型的能力亮点也从生成效果逐步延伸到制作流程中的可控性和修改效率。

这次升级的重要性需要放在字节AI业务加速商业化的背景下理解。2025年下半年以来,字节大幅增加了AI算力采购、基础设施建设和研发投入,2026年计划投入AI资本开支约2000亿元。

在语言模型侧,截至2026年6月,豆包大模型日均Token调用量突破180万亿。IDC数据显示,按Token调用量计算,火山引擎在中国公有云MaaS服务市场的份额达到49.5%。不过,Token调用量并不直接等于收入和利润,如何将技术投入转化为收入,是字节AI战略的关键。

字节近期的动作表明,其AI业务正在从扩大C端用户规模转向通过火山引擎开拓企业市场。相比竞争激烈、价格不断下探的通用模型API,视频生成的单价和商业价值更高,也有更大的毛利空间。广告公司、制造企业和影视机构等行业存在持续生产营销素材、产品视频和影视内容的需求,也更愿意为稳定、可控的视频生成能力付费。

Seedance系列模型在这套商业体系中的价值也因此更加明确。此前,Seedance 1.0和1.5时期的市场竞争力有限,客户调用量也不高。Seedance 2.0发布后,短剧和漫剧制作公司开始采购火山引擎的视频模型服务。内容制作公司用模型生成AI视频,再进入抖音、红果等内容平台分发,流量和收入反过来刺激生产需求。字节因此有机会形成从模型、云服务到内容平台的商业闭环。

因此,Seedance 2.5是字节推动AI能力从消费级产品走向企业服务的重要一步。它要承担的,是提高这条链路中的可用率和生产效率,成为火山引擎体系中具有增收潜力的产品。对字节而言,Seedance 2.5的意义是把技术优势转化为可以反复交付的生产服务能力。

*题图来源于Seedance 2.5官网。