办公小浣熊桌面版实测 – 简历优化、行业调研一步到位01. 用AI找工作02. 一些分享

LibTV深度动作捕捉实测 – 一键搞定口播粗剪01. 深度动作捕捉是什么?02. 深度动捕对比实测03. 智能剪辑04. 一些分享

最近那种 AI 换角视频很容易刷到。虽然角色变了,但动作熟悉,成片很容易让人看完。

但是直接把参考视频直接交给模型,原演员的面部特征、衣服、身材和背景,往往会跟着动作一起混进成片。

LibTV 这次上线的深度动作捕捉,完美解决了这个问题。

我们上传参考视频,LibTV 会一键提取视频中的深度动态信息,将动作、走位、运镜和空间关系转化为更干净的生成参考,尽量减少原人物、服装、场景与画风对结果的干扰。

01. 深度动作捕捉是什么?

 

可以把深度动作捕捉理解成一张会动的空间草图。

普通参考视频里,演员长相、衣服、背景、动作和镜头全混在一起。深度视频会把画面重新处理,不同灰度代表物体与镜头之间的距离。谁站在前面、手臂往哪挥、两个人离多远、镜头怎么推进,这些信息会被保留下来;五官、颜色和背景纹理则会淡化。

把这张动态草图交给视频模型,就能让新角色沿用原片的动作和运镜。

这类方法适合武打、舞蹈、多人走位和需要复杂运镜的视频。深度信息主要管怎么动,角色参考图负责长什么样,提示词再补充服装、场景和武器。

 

02. 深度动捕对比实测

 

这次测试主要看,深度动作参考能否减少原人物、服装和场景的干扰,同时保住双人交手、腾空翻身、镜头拉远以及背靠背收剑时的空间关系。

动作素材:

  • 角色素材:

这组素材同时测试换角色和双人关系。原视频里是两名真人剑客,目标成片改成熊猫与老虎在雪后竹林交锋。生成结果只要残留真人面孔、原服装、橙色烟雾,或者熊猫和老虎在遮挡后互换身份,都能直接看出来。

我们将动作素材上传到 LibTV 后先用深度动作捕捉功能,提取原角色的动作信息。

提取完成后,深度信息视频会以节点的形式呈现在画布上,我们接下来的视频生成就可以调用。

我们使用深度信息视频与上传的角色素材一起来生成新的视频。

提示词:画面中只出现角色参考图里的熊猫剑客和老虎剑客。开场左侧戴斗笠的动作位固定绑定熊猫,开场右侧束发剑客的动作位固定绑定老虎,全程不得互换。严格保留参考视频里的攻防顺序、剑招方向、挥剑轨迹、格挡时点、步法、身体转向、腾挪、两人距离、交叉遮挡和镜头运动。熊猫始终保持黑白毛色、深蓝窄袖武服和宽檐斗笠;老虎始终保持橙黑条纹、米白武服和棕红护肩。两名角色各持一把无装饰的中式直剑,剑身笔直、长度稳定,碰撞时不得融合或消失。场景改为雪后竹林中的石台,清冷月光,薄雾,地面有少量积雪。11.54 秒,16:9,电影级写实 3D 动画,单镜头连续运动。两名角色的物种、服装和体型全程一致,脚底接触地面,四肢结构正常。画面中不增加第三名角色,不出现字幕、标识或水印。

角色和场景都换掉了,但原片的动作骨架却还在。熊猫与老虎的站位没有互换,近景交手、腾空翻身、镜头拉远和最后背靠背收剑,都能在原片里找到对应关系。

有友友可能说,我不用这个直接用原视频生成,不是也行吗?那我们直接用原视频和两个角色图生成试试,除了没有用深度信息视频,其他条件一致。

生成的视频如下:

直接参考组问题主要出现在高速动作上:老虎的窄袖被拉成了接近原片的大袖轮廓,脸和身材也被对应拉长了。所以这样生成的视频仍会携带部分原始人物外轮廓,与单纯的参考动作不符合。

我们换一个场景不停变化的视频再试试深度动作捕捉能不能消除场景的影响。

原视频素材:

替换人物素材角色A:

替换人物素材角色B:

我们用深度动捕和素材角色去生成新视频。

提示词:

使用已提取的深度动作视频作为唯一的动作、走位、运镜和空间关系参考,使用角色 A 与角色 B 的参考图作为唯一外观参考。将原视频中的两名真人完整替换为两名身高和体型接近的轻型赛博机甲。

角色 A 全程保持珍珠白主装甲、钴蓝色胸甲与四肢装甲、黑色柔性内层、青色水平目镜和青色灯带;角色 B 全程保持高饱和暗红色主装甲、哑光黑色内层、橙色 V 形目镜和橙色灯带。两名机甲都采用精瘦、灵活、接近成年男性武术演员的人体比例,身高、肩宽和四肢长度接近,肩甲贴身,腰胯和四肢关节清楚,不使用厚重装甲。

严格复刻深度动作视频中的近身格挡、连续拳脚、踢击、闪避、追逐、翻越和摔落动作,保留两人的起始站位、相对距离、接触时机、遮挡顺序、运动方向、镜头切换、景别变化和原有节奏。动作快速有力,同时保持机械关节自然弯曲,双脚稳定接触地面,手掌始终为五指结构。

场景改为未来工业货运舱:灰黑色金属墙面、狭窄通道、金属栏杆、货箱和顶部冷白工作灯。沿用参考视频中的空间布局与障碍物位置,让角色与栏杆、地面和货箱产生正确遮挡与接触。整体为电影级写实科幻动作片,金属材质真实,冷灰环境光搭配克制的青橙角色光,保留高速动作中的运动模糊。

19.3 秒,16:9,30 fps,保持参考视频原有镜头顺序和剪辑节奏。画面中只出现角色 A 与角色 B,不增加其他人物、武器或无人机,不出现字幕、标识和水印。

动作真的跟住了。开场近身交手、连续踢击、追逐、翻越栏杆以及最后的坠落,都能在原片中找到对应关系;真人和仓库换成机甲与未来货舱后,人物距离和障碍物遮挡也没有被打乱。

 

03. 智能剪辑

 

群里经常有友友问我,有一键剪口播的软件吗?

我在做动捕测试的时候刚好看到了,LibTV 出了一个智能剪辑的功能。

所以我就给了 LibTV 一段 GPT 5.6 发布会的直播视频来测试下,发布会有人物采访、手机演示、网页录屏来回切换,  LibTV 需要按观点和功能模块重组,不只是完成按静音和停顿删减。

上面这个就是我们本次的素材,我们点击智能剪辑生成一个节点。

我们输入提示词之后,啥都不用管,LibTV 自己会生成需要的素材,并按提示词剪辑好。

提示词:请将这段约 10 分钟的英文产品发布视频,智能剪辑成一条 2 分 30 秒至 3 分钟的横屏科技资讯视频,画幅保持 16:9。 核心主题: ChatGPT 面向办公和团队协作推出了哪些更新,以及它怎样结合聊天记录、网页、表格和 PDF 完成真实工作。 剪辑结构: 1. 开头 8 秒直接使用原片中“we’re also announcing three major product updates”附近的内容,并快速穿插手机端、ChatGPT 网页、Excel 表格和 PDF 演示画面。删除寒暄和人物介绍。 2. 用 20 秒左右交代背景:团队已经在写作、资料查询和工作分析中使用 ChatGPT。 3. 保留网页端、移动端以及调用团队资料的演示,重点呈现 ChatGPT 如何获取上下文并回答临时工作问题。 4. 保留财务团队更新 Excel 预测模型、查看 forecast 和 drivers 的演示。 5. 保留最后将电子表格、PDF 等文件交给 ChatGPT 分析,并整理成汇报材料的过程。 6. 结尾使用能够体现“precision and correctness”或最终交付结果的原片内容,不添加脱离原片的新结论。 删减要求: 删除重复表达、寒暄、笑场、无信息停顿、等待加载、重复输入和过长的鼠标操作。 口播必须保留完整句子,不能在单词中间切断。 演示画面要与正在讲解的功能对应,避免声音讲表格时画面仍停留在人物访谈。 等待和输入过程可以加速到 1.5 至 2 倍,人物讲话保持正常速度。 每个镜头尽量保持 3 至 6 秒,避免连续快速跳切。 画面要求: 保留原片已有的中英双语字幕,不要再生成一层重复字幕。 涉及表格、PDF 和 ChatGPT 界面时保留完整操作区域,不能裁掉文字、输入框和生成结果。 使用直接切换或轻微淡入淡出,不使用炫光、旋转、故障风等转场。 可以加入轻微的镜头推近,但不能影响字幕和界面阅读。 不要添加与内容无关的素材、产品名称、功能和数据。

最后得到了一条 3 分 06 秒的成片。LibTV 抓住了几段主要内容:手机端调用团队资料、财务团队更新预测模型,以及把表格和 PDF 整理成汇报材料。原片中的寒暄、等待和重复操作被删掉了,几段演示也没有被剪乱。

智能剪辑最受益的,应该是科技、财经、情感和知识科普这类口播创作者。

拍摄十分钟,真正耗时间的往往是后面的粗剪:编辑需要把素材反复看上几遍,逐一找出卡壳、重复、口头禅和无效停顿,再判断哪些话可以删、哪些内容必须保留。一条视频光是粗剪就可能花掉 1 到 2 小时,想保持日更,时间几乎全耗在这一步。

  • 说个小技巧

新手很多时候会忘记快捷键是什么,画面正下方就可以查看所有快捷键。

04. 一些分享

 

这一轮测下来,LibTV 两个新功能刚好对应视频生产里最费时间的环节:深度动作捕捉减少原演员和原场景对生成结果的干扰,让动作参考更容易重复利用;智能剪辑先完成筛选素材和搭建粗剪结构,创作者可以把时间留给节奏、字幕和最终检查。

Google Veo、可灵、Seedance、海螺和 Vidu 继续在模型提升上发力,LibTV 则深耕于处理素材、镜头、修改和交付。

LibTV 的长期优势取决于专用工具和工作流资产。模型可以接入,会被替换;创作者保存下来的节点、参考素材、Skill、镜头修改记录和团队协作方式更容易形成迁移成本。深度动作捕捉只是其中一个功能,却很适合验证这条产品路线。

AI 视频工具如今比拼的是角色一致性、动作控制和成片效率。生成几秒好看的画面已经很常见,能不能连续做、按要求做,并顺利接进创作者的工作流程,才会影响大家是否愿意长期付费。

原文链接:用 LibTV 的深度动作捕捉,人人都能复刻动作大片

滚动至顶部