实测 LibTV 独家深度动捕功能,AI 视频不用再“开盲盒”了

3 小时前10.2k
AI 视频不用再“开盲盒”了

刚接触 AI 视频制作的创作者,都会自觉遵循一条基本公式:合格视频 = 模型(下限)× 提示词(上限)。

但即便紧紧抱住这一公式,还会陷入另一种无奈。大多人在盯着进度条熬过几分钟,还是等来一个烫手的「残次品」。

比如 AI 创作者必备基本功——给角色动作套上参考视频。

AI 生成什么,有点像「开盲盒」。创作者大概率得到的成品是,AI 把参考人物元素照单全收,把你原本设定好的角色,又换了一身皮。

在尝试了Seeddance2.0、Minimax H3 等多个视频模型后,我清楚发现,AI 很难分清动作和长相,你让它学动作,它把人、衣服、背景都抄了一点,这种不确定性就像一颗时不时就会踩中的「地雷」,令人头大。

直到 LibTV 上线了「深度动作捕捉」功能后,才让这条路没那么难走。动捕功能的原理,是让 AI 把「动作」从「画面」中剥离出来,也让创作者意图第一次越过提示词桥梁,落到正确的位置上。

类似的提质增效功能还有智能口播剪辑,AI 直接挑起剪辑大梁,把繁杂琐碎的素材按照合理的方式整合到了一起,把剪辑师耗费心力的累活干完了。

我的完整测试过程如下,包括翻车、调整和最终对比。

1、直接生成 VS 深度动捕,差距直观

这次设定的场景是赛博朋克游戏世界,给女性玩家设定些动作戏。参考视频选了一段动作戏,人物利用蛛丝摆荡、跳跃、俯冲,在城市楼宇间穿梭,动作幅度大,空间关系明明确。

在 LibTV 的无限画布中上传参考视频,同时提供角色参考图,提示词很简单:

但直接生成的效果明显翻车。角色确实被替换成了女性形象,但参考视频中的动作特征几乎未被捕捉。生成角色在服装细节上明显残留了原视频的视觉元素。

可以说,动作没抄明白,衣服几乎都抄了过去。

随后调整提示词,在文字上做加法,强调严格复刻动作节奏和运镜轨迹,重新生成。

但花费 200 积分后的效果,用四个字概括:不能细看。

运镜大致接近,但动作细节大量丢失,原本标志性的摆荡动作被简化为直线俯冲,动态幅度和身体协调性均未达到预期。

在直接生成难以获得理想效果后,我尝试了深度动作捕捉功能。

操作路径如下:在视频功能面板中展开「逐帧拉片」下拉菜单,选择「深度动作捕捉」,处理规格选择 720P(480P的输出视频参数可能不够生成规格,不推荐)。

很快就会得到一个灰白片,不含色彩、纹理或人物面部信息,仅保留运动轨迹与空间层次。

将该深度参考节点连接至视频生成模块,按照对照试验标准,提示词与模型参数保持不变。

把原片、动捕灰片、生成视频三者放一起对比,非常直观的效果。

生成视频的动作轨迹在连贯性和节奏感上与参考视频高度一致,但角色、场景、画风完全替换为目标设定,未残留原视频的任何视觉特征。对强迫症很友好了。

深度动捕灰片到底干了啥?总结就是把「动作」和「画面」解耦了。

AI 不再将原视频的色彩、纹理、人物特征作为学习对象。动态精准与视觉可控,在同一个生成结果中同时成立。

那玩法也可以大胆起来。

比如,只要给一张角色素材图,任意角色都能「赛博朋克」。跑跳动作一致,角色特征各自独立。

真人同样适用。我把这套丝滑连招直接套在了同事身上,效果干净利落,动作节奏与参考视频高度同步,只是画面里的人换了。

更进一步,既然动作与背景可以被剥离,那背景完全可以自行 DIY。比如截取一段电影画面,提取动作骨架后,换不同场景,生成风格各异的成片,只需要改提示词里的背景描述。

如果把脑洞再放大一些,汽车也可以。让小米 SU7 Ultra 像大黄蜂一样变成「汽车人」。不是靠动画逐帧手 K,而是把动作提取后映射到车辆上。

动作骨架通用,载体不限。有点「万物皆可动捕」的意思。这种跨形态的迁移能力,可能才是深度动作捕捉在创作流程中真正的变量。

2、口播剪辑,不是「体力活」了

LibTV 同期上线的「智能剪辑-口播视频」功能,则是进一步解放剪辑师双手。

操作路径也很直观。在无限画布中点击添加「智能剪辑」节点,选择「口播视频」,上传原始素材,包括口播片段和补充画面。在提示词中说明剪辑意图,设置目标时长,提交即可。

这个功能直接回应了一个现实,日更博主的产能瓶颈往往不在内容本身,而在剪辑台前那 1 到 2 个小时的重复劳动。

将总计时长两小时的口播素材和散落素材剪辑成一条 3 分钟的成片,对肩颈、注意力和耐心都是一轮高压测试。

具体能干啥?

一是粗简。自动完成素材转录、标记废片段、去口水词、停顿和重复内容。多段素材自动拼合,形成连贯的逻辑线。我们选择了过去测评智驾的素材进行测试,7个零散视频片段导入后,AI自动删除卡壳内容,并挑出花字候选,输出一条叙事完整的粗剪版本。

二是精简包装。在测试视频中,AI可以自动生成字幕并智能断句分行,匹配对应素材,还能根据内容关键词动态添加花字和上屏音效,匹配背景音乐。

成片如下,虽然稍有瑕疵,但整体完成度还比较高。

三是成片修改。如果觉得哪里不对,比如某个花字上屏时间早了、某段 BGM 节奏没对上,不用重新剪一遍,直接在对话框里用自然语言告诉 AI ,它会自己修改。甚至还有自动审片功能,能帮你识别编排逻辑、漏剪口误、字幕错字、黑帧闪帧这些问题。

原本1 到 2 小时的剪辑时长压缩至 15 分钟左右后,剪辑师也不用再逐帧盯防,可以把更多精力集中在内容创作上。

3、写在最后

无论是深度动捕,还是智能口播剪辑,LibTV 的功能升级都围绕一条主轴,即 AI 能否听懂创作者的意图。

  • 1.0 阶段,创作靠手搓,软件交互复杂,技术门槛高。
  • 2.0 阶段,AI 进场,创作依赖提示词,但开盲盒成分大。
  • 3.0 阶段,AI 开始理解意图,创作变成了「表达想法」,可控性提升。

到这里,AI 视频创作才算跨过了那条尴尬的河,核心竞争力回归到了选题、观点、审美、画面等内容本身。

另一个视角是,AI 短片井喷,观众的审美水位在涨。画面质感、角色一致性、动作流畅度,这些硬指标正在筛选谁值得被留下。

LibTV 在 AI 可控性上的投入,会最终落地到内容质感上。用户可以直接访问官网 https://www.liblib.tv/体验一番。

毕竟 Token 很贵,不能浪费。AI 创作能力向上多一寸,创作者就能在巨人肩膀上,多发掘一寸属于自己的表达。

格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。

App内直接打开
商务、渠道、广告合作/招聘立即咨询

相关文章

九月加息,最不坏的选择?

申万宏源宏观 · 55分钟前

cover_pic

3.8万亿、26项重点任务,信息通信“十五五”背后的资本暗线

览富财经 · 2小时前

cover_pic

利润增长15%,中国再保(01508.HK)做对了什么?

贝隆行业研究 · 2小时前

cover_pic
我也说两句