友友们,Seed-2.1-pro 大模型终于升级了,豆姐也是好起来了。
这次更新到了 Seed-2.1-pro-0915 版本,新版重点加强了多模态 Coding 和 Agent 能力。模型更擅长看懂设计图、界面截图和复杂文档,再把这些信息用到实际工作里。
写代码时,新版能更好地理解已有项目,找到需要修改的位置,处理跨文件问题,并运行检查。读财报、查资料、改 PPT 时,对密集表格、图中细节和跨页脚注的理解也更强,取证、计算和交付会更可靠。
这轮更新还强调了 Token 效率,在完成任务的同时,能减少消耗和使用成本。
不过,升级说得再好,实测出来好用才是硬道理。给大家看看其中一个案例,真的很不错:
01. 多案例实测
这次更新的模型,大家可以去火山引擎接 API,也可以直接在豆包工作里使用,我这次测试大部分案例都是在里面生成的。
Case 1:3D 工地
这个 case 主要测试模型的三维空间理解、图到代码,以及复杂场景的完整开发。模型需要把看懂的空间关系真正写进运行逻辑,画面才不会出现卡车穿楼、塔吊互撞。
参考图:
提示词:
根据上传的 construction_plan.png 和 construction_massing.png,用 WebGL 和 Three.js r160 创作一个细节丰富、持续运转的「体素微缩建筑工地沙盘」,交付单个 construction_diorama.html,可在联网状态下直接双击用 Chrome 打开,无需本地服务器或构建步骤。
仅允许从以下 CDN 加载 Three.js:
https://cdn.jsdelivr.net/npm/three@0.160.0/build/three.module.js
除此之外,不加载外部模型、图片、贴图、HDR、字体、音频或其他库。全部几何体、材质、纹理和图形效果使用代码生成,CSS、JavaScript 和 shader 均内联在 HTML 中。库加载失败时显示清楚的提示,不能留下空白页面。
先完整读图,识别坐标方向、桌面与沙盘尺寸、各区边界、道路、入口、塔吊位置和关键高度。图片是这些空间参数的来源。将识别值组织为 scene_spec 数据,嵌入 HTML,并在交付说明中列出读图结果和疑点。不能把设计图贴在地面上冒充三维还原。
- 场景与构图
整套微缩工地摆放在室内深色实木工作桌上,桌角散落代码绘制的蓝图、钢卷尺、安全帽摆件和金属水平仪。默认相机模拟成年人站在桌前观察,略微俯视,能看清完整沙盘及桌边控制器。
工地划分基坑开挖区、钢筋加工棚、物料堆放区、在建高层楼房基座、临时板房办公区、渣土区和施工道路。分区、入口、双塔吊位置和标高按图纸还原,整体可统一缩放,比例与相对位置不能任意改动。道路与人行路线可辨认。保持丰富而协调的色彩、明显的体素颗粒和真实的微缩比例感。
- 动态机械与作业关系
至少包含 2 台挖掘机、3 台渣土卡车、2 台塔吊、1 台混凝土搅拌罐车和 1 台小型装载机。
挖掘机执行挖土、抬臂、回转、装车的动作;卡车按等待、入位、接土、满载运输、卸料、返回循环运行。车厢土方量必须随装卸变化,车辆未停稳时不能开始装土。
塔吊通过回转、变幅或小车移动、吊钩升降,吊运钢筋和混凝土料斗。吊物、吊索与吊钩保持连接,吊运路径避开楼体和其他塔吊。搅拌罐车的罐体转动,装载机在限定区域平整地面。
- 工人与细节
至少 32 名体素工人分布在不同岗位:绑扎钢筋、搬运建材、指挥吊装、操作工具,以及在出入口巡逻。动作错开节奏,避免所有人同步摆动。
补齐围挡大门、警示彩旗、施工指示灯、临时照明、脚手架、钢筋堆、水泥堆、砂石堆、水电杆和安全标识。工人、设备与物料的尺度一致;标识和蓝图可用 CanvasTexture 生成。
- 昼夜与模拟天气
实现黎明、正午、黄昏、夜晚的平滑循环,通过窗外天色、室内入射光和工地灯光共同体现,始终保留室内桌面沙盘的场景关系。
夜间亮起工地探照灯、塔吊灯和板房暖色窗灯,尘土粒子缓慢飘散。
空格键切换模拟暴雨:雨滴仅在沙盘范围内出现,地面逐渐湿润并产生反光,施工灯变亮、尘土减弱,车辆减速,塔吊完成必要的安全停靠后暂停吊运。关闭暴雨后平滑恢复,不能让设备或吊物瞬移。
- 相机与实体控制器
鼠标拖拽环视,滚轮缩放;闲置数秒后自动缓慢环绕,操作时立即停止自动环绕。限制相机高度、距离和角度,不能钻入桌面或模型。
在桌面前方制作可点击的实体旋钮或拨杆,通过射线拾取实现:设备速度 0.5×/1×/2×、昼夜循环开关、尘土强度低/中/高。控制器需要有可辨认标签、状态反馈和转动或拨动动画,不能只用屏幕悬浮按钮代替。
区分点击与拖拽,拖动相机时不能误触开关。
- 新增「夜间混凝土浇筑」场景
增加一个桌面实体按钮,点击后在同一座沙盘内演示夜间浇筑:镜头平滑聚焦楼房基座,施工照明开启,搅拌车沿道路驶入,工人引导,车辆停稳后展开卸料槽并卸料,作业完成后收回卸料槽、沿道路离场。
提供返回常规作业的操作。进入该场景时暂停昼夜自动变化,退出后恢复原设置。若正在暴雨中,先显示等待或进入安全暂停状态,不能强行开工。保留沙盘内其他区域的空间和设备状态。
- 碰撞与边界
先规划空间占用和安全作业范围,再实现运动。车辆使用有车距和路口让行的路线;机械臂、吊臂和吊物约束在各自工作范围内;人员避开车道和吊装区域。可用状态机、包围盒和预定义安全轨迹实现。
除铲斗挖土、落料等有意设计的施工接触外,不得出现可见的车辆互穿、吊物穿楼、人员穿车、吊臂相撞。所有工地模型及其运动包络都留在沙盘内,雨滴、尘土不能落到桌外。全局调速后这些约束仍要成立。
- 性能与交付
以 1920×1080 下接近稳定 60FPS 为优化目标。重复体素、工人部件、围挡和堆料大量使用 InstancedMesh,复用几何体与材质;尘土和灯光光晕用自定义 shader 实现。控制投影光源数量、阴影开销和粒子数量,避免每帧创建大量对象。
必要时调整渲染像素比、阴影分辨率和粒子密度,但不得删除主要施工区域、机械或功能来换取帧率。角落显示实际测得的 FPS,可收起;不要写死性能数字。
自行打开 HTML,用同一观察方向将三维场景与两张参考图核对,检查分区、数量和高度,再检查完整装卸循环、两台塔吊、实体控制器、夜间浇筑、暴雨切换与相机边界,再修复发现的问题。实际测过性能时记录分辨率、像素比、浏览器和帧率;未测时如实说明,不承诺所有硬件都稳定 60FPS。
最终交付完整的单个 HTML 文件,附简短操作说明和实际验证结果。不要只给截图、概念说明、代码片段或需要额外素材的工程目录。
基坑、加工棚、在建楼房和运输道路摆在正确的位置,塔吊与车辆又给场景补上了动感。按下空格,晴天切成暴雨,雨滴和灯光也跟着变化。加载完成后的短时采样接近 60FPS,复杂度和可运行性都有了。
Case 2:机器人仓库
这个 case 主要测视觉信息定位、业务规则理解和长任务执行。封错一条路,后面的路径与订单结果就会受影响。成品需要一座可旋转的三维仓库,机器人、运输轨迹、拥堵热力图和订单进度一起变化。
封堵图:
提示词:
根据提供的 warehouse.json、orders.json、数据说明.txt 和 roadwork_notice.png,制作一个可在本地运行的「仓储机器人调度中心」。
warehouse.json 给出基础路网和规则,orders.json 给出订单。两次临时封路的位置与时间只在 roadwork_notice.png 中给出。请识别红线对应的道路边及时间区间,保存为 events.parsed.json,再据此实现调度。图中节点编号与基础路网一致,不得把图像当成无须读取的装饰。
视觉要求:
– 主画面为可旋转、可缩放的三维仓库,按地图摆放货架、取货站、出库站和机器人。
– 使用有工业质感的货架、可辨认的货箱、不同颜色的机器人,以及清晰的路线轨迹。机器人装货后应有可见的载货状态。
– 使用深色控制台、冷色照明与少量橙色告警。道路封闭时显示围挡和红色提示,避免满屏装饰遮住运行情况。
– 配置订单队列、机器人状态、事件时间轴及拥堵热力图,适合 16:9 录屏。
仿真要求:
- 按释放时间接收订单,每台机器人同时执行一个订单,完成取货、装货、运输和卸货后才算交付。
- 遵守数据中的节点占用、道路容量和行驶时间规则,处理相向冲突、争用同一节点和站点阻塞,不能穿越货架或瞬移。
- 自动处理两次封路事件。封路期间禁止新进入相关道路,封路前已经进入的机器人允许驶离;需要时重新规划路线。
- 显示待处理、执行中、已完成和逾期订单,以及实际行驶里程、准时率和机器人利用率。写清统计口径,所有数字由运行状态计算。
- 让所有订单最终得到处理;如出现无法继续的状态,显示原因并保留日志,不要伪造完成。
交互要求:
– 运行、暂停、重置及 1×/2×/4× 倍速。
– 点击机器人跟随镜头,点击订单查看取送位置和执行机器人。
– 支持二维俯视与三维视图切换。
– 通过历史时间轴回放已经发生的运行过程,回放不能篡改原始记录。
调度使用固定的排序与随机种子,重置后结果可复现;切换倍速只改变播放速度。无需模拟电池、充电或连接真实设备。
交付源码、启动说明、events.parsed.json、完整运行日志及验证结果。对每个封路事件附来源图片区域,便于核对读图。实际检查订单是否遗漏或重复完成、是否发生道路或节
四台机器人把 60 个订单全部送完,封路期间也没有硬闯禁行路段。这说明地图、订单和封路通知已经进入同一套调度逻辑,三维仓库里的运动有数据依据。
Case 3:激光游戏
这个 case 测视觉符号理解、图像定位和游戏开发。模型既要读对镜子与墙的位置,也要把反射、循环检测和求解规则实现出来。
初始关卡图:
点冲突,以及封路是否生效。自行运行页面、修复发现的问题,再交付成品。
规则:
提示词:
根据上传的 laser_puzzle.png 和规则.txt,制作一个可在本地运行的「三色激光实验室」解谜游戏。
图片是关卡布局的唯一来源。请先识别网格大小、三种光源的位置与方向、12 面镜子的位置与初始方向、墙体和接收器,并保存为独立的 level.json,便于核对。
不要自行更换关卡或移动物体,也不要提前把镜子改成通关状态。
视觉要求:
– 将二维关卡还原成悬浮的三维实验台,提供俯视和斜俯视视角,保留可辨认的坐标。
– 墙体有高度,镜面有立体支架,三色光束清晰可追踪,并带适度的辉光和粒子流动效果。
– 镜子旋转时有平滑动画;接收器根据实际收到的颜色改变显示色,三色齐全时触发能量汇聚和通关动画。
– 页面包含关卡主视图、镜子操作次数、接收颜色状态和简洁的控制面板,适合 16:9 录屏。
游戏要求:
- 点击任意镜子,在 / 与反斜杠两种方向间切换,重新计算全部光路。
- 严格按规则处理反射、墙体遮挡、出界、进入光源格和循环状态,光束不能穿墙。不同光束在空格交叉时互不影响。
- 接收器同时收到 R、G、B 三种颜色才算通关,判定必须来自当前光路计算。
- 支持撤销、恢复图片中的初始状态、逐段播放光路,以及点击查看每面镜子的编号和方向。
- 实现自动求解器,基于识别出的关卡搜索镜面方向组合。提供「提示一步」和「演示完整解法」,演示时逐面旋转镜子,并同步更新光路。
- 求解功能与玩家操作使用同一套光路规则,不能把预先写死的方向列表当成搜索结果。
请自行完成读图、实现、运行检查和修复。交付源码、启动说明、level.json、求解结果和验证记录。实际验证初始状态未通关、求解后满足三色接收、旋转和撤销均正确,以及循环光路不会导致页面卡死。
图片里的规则和布局确实被读进了程序。12 面镜子对应 4096 种组合,程序找到了唯一解,翻转 7 面镜子后,三束光都进入了接收器。
Case 4:PPT修改
这个 case 测图文理解与 Office 交付能力。改稿要兼顾全局一致性和局部保留,收入、毛利率和交付率也得重新核算。一次需求里完成改稿、渲染和回读检查,比只生成一张漂亮页面更能看出办公能力。
原始PPT:
原始数据:
修改批注:
提示词:
请按 review_notes.png 中的全部批注,修改「经营复盘_初稿.pptx」。经营数据.xlsx 是数值来源,「原稿第2页.png」用于核对原始版面,全部内容均为合成测试资料。
先识别图片批注,把每项要求对应到具体页码、对象和修改范围。批注的颜色、排序、保留内容和统计要求都需要落实,不要跳过图片直接套用一份通用模板。
- 保持原来的四页顺序和主题,根据批注更新标题、统计期、关键数字、图表、区域排序、配色和注释。保留图片指定不改的文字。
- 从源表重新计算汇总值、同比、毛利率及准时交付率。公式、单位和分母要一致,全文及图表中的相关数字一起更新。源表中没有的数据保留缺口,不自行编造。
- 按批注中的视觉方向完成整套版式,使用清楚的数字层级、充分留白和统一图表样式。提高图表与数字的可读性,保持 16:9,避免密集说明挡住图形。
- 交付可编辑的「经营复盘_修订.pptx」,文字保留为文本框,图表和表格保留为可编辑对象。不要把页面拍平成图片,也不要改写或覆盖上传的原稿和源表。
- 同时交付 calculations.json,记录各项指标的公式、取数范围、单位和结果;提供批注落实清单,能对应到最终页码和对象。
- 生成每页预览图,实际检查遮挡、溢出、文字截断和图表错位,再回读最终 PPT 核对页数、数字和保留内容。检查完成后再说明实际交付状态,不能仅凭文件写出成功就宣称全部正确。
所有修改一次完成,过程中自行处理问题。若环境确实缺少编辑或渲染工具,如实说明缺少的能力和未完成步骤,不用截图冒充可编辑文件。
收入补齐到了 3600 万元,毛利率重算为 40.0%,准时交付率也按 671 单除以 700 单得到 95.9%。区域图表的顺序和颜色一起改了,要求保留的服务承诺也还在。交付的 PPT 里有原生图表、表格和文字,后续还能接着编辑。画面走的是稳重商务风,亮点在于批注、源数据和最终页面基本对上了。
Case 5:交付核验
这个 case 测密集图文解析、跨源核验和工具调用的可靠性。模型需要处理重复导出、验收修订、退回和跨月事件,再把每个数字追到证据。
出厂登记:
验收单:
企业资料:
提示词:
请核验上传资料中虚构企业「星澜工造」的三条主张,统计时点统一为 2026-07-31 23:59:59,时区 Asia/Shanghai:
– 首批 200 台机器人已全部交付。
– 这 200 台中,80% 即 160 台已完成客户验收。
– 已交付机器人全部为 R2 型号。
请以提供的文件为证据边界,读取任务范围、统计口径、物流与验收导出、修订说明,以及 registry_scan.png 和 acceptance_revision_scan.png,独立给出核验结论。
两张扫描页包含必要信息:型号登记只在 registry_scan.png 中,acceptance_revision_scan.png 的修订尚未合入验收 JSON。先从图像提取结构化登记与修订记录,再与明细合并核验。引用需标出文件、页号或图像区域,无法辨认的字段要保留疑点。
需要区分产品与配件、预创建运单与实际揽收、客户签收与验收。处理重复事件和被修订记录,按核验时点重建状态;后续发生的事件不能改变当时的完成情况。识别转载之间的来源关系,不把重复宣传当成独立证据。
制作一个可本地运行的「交付证据指挥台」:
- 以三维工厂、仓库和客户节点展示货物流向,按实际核验状态区分在途、签收、返仓等连线。locations.json 中的坐标只用于合成场景,不对应真实地理位置。
- 页面保留三条主张卡片,分别显示核验结论、支持证据、反证与证据缺口。
- 设置可拖动的历史时间轴,切换时重新构建截至该时刻的物流与验收状态。提供返回固定核验时点的按钮。
- 点击数字、产品节点或证据连线,能展开原始记录,定位文件名、event_id、record_id 或图片中的具体区域。
- 用来源关系图显示宣传稿与转载的关联,避免把同一消息画成多份独立支持。
- 使用深色控制台、简洁的三维建筑、动态流向和适量告警高亮,保证文字和证据可读。
交付可运行项目、图像提取 JSON、逐主张报告、状态重建脚本与完整引用清单。保留每条修订对应的原图区域和被替代记录,支持点击查看。数值必须可由原始数据复算,百分比必须写清分母;证据不足时保留缺口,不编造原因或外部材料。
自行检查数据汇总、时间轴回放、来源跳转和三维显示是否一致,修复问题后交付。
120 台签收,扣掉退回的 10 台后只剩 110 台净交付;再合并扫描件里的验收修订,真正通过验收的是 90 台,占原计划的 45%。已交付的机器中还混着 40 台 R1,提示词中的三条主张都找到了对应反证。
Case 6:读财报,做经营模型
这个 case 主要测密集图文读取、跨页脚注理解和分析交付。
财报:
提示词:
请读取上传的「砺川智造」财务资料图像,完成可复算的经营分析,并交付带公式的 Excel 模型和可本地运行的交互经营看板。
所有财务数值和计算口径来自图片。先识别表头、年份、累计期、单位及附注,再提取结构化数据。阅读全部页面后确认是否存在修订、单位差异和跨页引用;不要只读首页或把每列都当作单季度。
分析要求:
- 为每条提取值记录原始数值、单位、期间、最终采用值、页码与图像区域。存在更正时保留原值和替代关系,避免重复调整。
- 统一金额单位,还原 2024、2025 年四个季度的单季收入与成本,并计算年度收入增长、毛利、毛利率、经营利润和自由现金流。
- 核对分部收入与总收入,按图片约定计算应收账款和存货周转天数,分析收入、利润与现金流变化是否一致。结论只能由材料支持,不编造业务原因。
- 按第 5 页参数建立 2026 年情景预测和二维敏感性表。假设保持可编辑,修改后预测与图表自动更新。把历史值和情景值清楚区分。
交付与视觉:
– model.xlsx 包含原始提取、口径调整、历史计算和情景分析。计算结果使用可检查的公式,来源页号放在对应数据旁,不能将全部结果写成常量。
– 交互看板使用有空间层次的经营展台:收入分部、季度趋势、利润与现金流桥图、敏感性热图围绕同一组选定年份联动。保持准确的比例、坐标、色标和数字,不为了三维效果扭曲统计关系。
– 点击指标能展开计算过程与来源图片,定位对应表格或脚注。调整预测参数时,看板与导出的模型使用同一口径。
– 提供 extracted_data.json、分析脚本、计算结果与简短报告,说明异常、修订和仍然缺失的证据。
自行运行计算,抽查更正前后差异、累计转单季、单位换算、汇总勾稽和公式更新;渲染并回读 Excel,打开网页检查联动与来源跳转。报告实际完成的检查,不编造工具结果或调用记录。
资料完全为虚构案例,不做真实企业估值、投资建议或外部资料补充。
这组财报题,难点藏在页面的口径里。前面还保留原报数据,后页又给了更正公告,还有千元与万元、累计值与单季值的差别。最终模型采用了更正后的比较数,把收入同比算成 20%,情景参数变化后,Excel 公式和网页计算也能得到对应结果。
Case 7:做白模,再生成视频
最近先做白模再生成视频的视频制作流程非常火,因为这样能保证视频画面走向非常正确。
所以这次先让 Seed-2.1-pro-0915 通过 Blender MCP 搭出白模,安排人物动作和摄影机,再把预演视频交给 Seedance 生成成片。能看到 Seed-2.1-pro-0915 的三维空间理解、复杂动作编排,以及调用 Blender 完成建模、动画、检查和导出的能力。
白膜布局图:
提示词:
我的电脑已经安装 Blender。请在当前 Claude Code 环境中,先自行检查、配置并连接 Blender MCP,再读取上传的 layout_plan.png,在 Blender 中制作一段「滑板手穿越旧厂房」的三维白模预演动画。交付可编辑工程和实际渲染的视频,供后续 Seedance 参考人物动作、空间布局、镜头和速度节奏。
零、先完成 Blender MCP 连接,再开始制作
我授权你为本任务安装缺少的 uv 和 Blender MCP、配置当前 Claude Code 项目的 MCP 服务、启动本机 Blender 的专用工作实例,并执行连接检查。复用已安装的 Blender 和可用依赖,保留现有工程、其他 MCP 配置,以及当前模型和 API 路由。普通安装、配置和连接工作直接执行,不要只返回一份让我照做的教程。
- 检查当前操作系统、Claude Code 是运行在 Windows 本机还是 WSL、Blender 可执行文件路径与版本,以及 uv、uvx 和现有 Blender MCP 的状态。已有可用连接时直接复用;未连通时先看实际错误,再补齐依赖。仅从 uv 官方入口和 Blender MCP 项目维护者提供的渠道安装,记录实际使用的路径及版本。
uv 安装说明:https://docs.astral.sh/uv/getting-started/installation/
Blender MCP:https://github.com/ahujasid/blender-mcp
Claude Code MCP:https://code.claude.com/docs/en/mcp
- 安装或定位与 MCP 服务匹配的 Blender 插件,可参考当前项目文档中的 uvx blender-mcp install-addon。优先通过本机 Blender 的 Python 启动脚本,在专用实例中启用插件并启动连接所需的监听服务;具体模块和启动接口以已安装插件代码为准,不凭空猜测。若必须通过界面操作,先用当前可用的桌面控制工具完成。
- 在当前项目添加或修复名为 blender 的 stdio MCP 服务。依据当前 CLI 帮助使用 claude mcp add –transport stdio –scope local blender —
blender-mcp,其中路径必须替换为实际找到的路径。先检查已有配置,避免重复添加或覆盖其他服务。根据实际运行环境核对插件的主机地址、端口及进程,确认服务连接的是本任务使用的 Blender 实例。 - 通过实际 MCP 请求读取当前场景信息,并获取一张对应的视口截图,检查返回内容和真实场景一致。配置写入成功、端口可访问或 claude mcp list 显示 Connected,都不能单独当成 Blender 已经可操作的证明。两项实际调用通过后直接继续下方制作任务,不再询问是否开始。
- 如果当前会话无法加载新工具,或某一步确实需要人工点击、确认权限,先完成其余可执行的配置,把完整任务、已完成步骤和下一步保存到 CONTINUE.md,再只告诉我必须完成的那一个操作。需要时说明如何在 /mcp 中重连,或重启 Claude Code 后恢复当前会话并读取 CONTINUE.md。不要自行终止当前会话,不要让我重新复制整段需求,也不要把未完成的连接写成成功。此类必要的环境操作单独记录,不算成模型自行完成。
在 check_report.md 中将首次环境配置时间、人工操作和后续建模渲染时间分开记录。对比新旧模型时,使用同样已准备好的连接环境评测制作能力。
总长 12 秒,24 FPS,共 288 帧,16:9,1280×720。全片使用一台连续运动的摄影机,不切镜头。建筑、人物、滑板和道具全部用 Blender Python 创建,采用灰白材质与清楚的接触阴影;人物和滑板可略深于建筑,方便辨认。不下载模型、贴图、动作库或 HDR。
一、先读图,再搭建空间
识别图上的坐标方向、尺寸、墙体、两个门洞、立柱、障碍物、人物路线、环绕区域和空间高度,将结果保存为 scene_spec.json。建筑尺寸和物体位置以图片为准,不把图片铺在地面上代替建模。
建立前院、封闭厂房和露天天井三个连通区域。厂房有真实厚度的墙体与屋顶,摄影机和人物只能通过指定门洞出入;屋顶采光窗可以透光,但不能临时隐藏墙体、屋顶或柱子来让镜头通过。路线箭头是人物的行进方向,摄影机需要另行规划安全路径。
二、人物和滑板
制作一个约 1.75 米高、能清楚辨认头、躯干、骨盆、上下臂、大小腿和脚掌的关节人偶。滑板具有板面、桥架和四个轮子,比例与人偶匹配。可以使用简化骨架或父子层级,不必制作面部和衣服
完整表现蹬地推进、双脚回板、屈膝转向、压板蓄力、起跳收腿、越过障碍、落地缓冲和恢复滑行。蹬地时一只脚支撑在板上,另一只脚实际接近并接触地面;收脚后回到板面。起跳时滑板随脚抬升,落地后轮子接地。不能只平移一个四肢不动的人偶,也不能让脚穿过板面、轮子穿地或人物悬空滑行。
三、十二秒的动作与镜头
0—2 秒:滑板手在前院完成两次蹬地加速,沿图示路线进入门 A。镜头从后轮侧后方追拍,离地约 0.25 米,能看见轮子、脚和前方门洞。
2—4 秒:镜头跟随滑板手通过门 A,进入厂房。人物按图中路线绕过立柱、转向中部通道,身体倾斜、双臂调整平衡;镜头平滑升至约 0.8 米,始终能判断人物与立柱的距离。
4—5 秒:滑板手靠近低矮障碍,屈膝压板,准备起跳。镜头移动到侧后方,为随后的环绕留出空间。
5—8 秒:人和滑板腾空越过障碍,进行一次慢动作展示。摄影机围绕移动中的人物完成连续 360° 环绕,从侧后方经过侧面、正面、另一侧,再回到侧后方;环绕半径约 3 米,相机高度由约 0.6 米平滑升至 1.4 米。全程让人物、板和障碍的关系可辨认,不能用摄影机原地自转代替围绕人物移动。
8—10 秒:恢复正常速度,完成四轮落地、屈膝缓冲、身体回正,再向门 B 加速。镜头顺势回到跟拍位置,衔接时不能突然掉头或跳位。
10—12 秒:人物与摄影机先后通过门 B 进入天井,摄影机确认离开建筑后再抬高,最后同时看见滑板手、出口和厂房外立面,展示确实穿过了同一栋建筑。
慢动作是成片时间的变化:起跳和越障的同一段运动被延长展示,人物、滑板与轮子的时间进度一致,摄影机仍按计划环绕。请用单调递增的运动时间映射或等价方式控制节奏,慢速进入和退出都要平滑,不靠人物空中悬停或重复播放帧凑时长。
四、空间约束和视觉检查
先为人物、板和摄影机规划可通行范围,再制作动画。人物和摄影机通过门洞时都要留有余量;绕柱和环绕时避开墙体、立柱和屋顶,人物腾空时确实越过图中的障碍。只有蹬地、脚踩板、轮子落地等预期接触可以发生。
利用 Blender MCP 查询场景、运行代码,并查看关键帧截图。至少检查进入门 A、绕柱、蓄力、起跳、环绕的四个方向、落地、通过门 B 和片尾。检查镜头是否穿墙、人物是否被柱子长时间遮挡、脚板关系是否正确、环绕是否满一圈、最后是否仍能看清出口。发现问题后自行修复,最后从头播放或逐帧检查完整导出视频。
五、交付
– previs.blend:保留物体命名、人物层级、动作和摄影机关键帧的可编辑工程。
– previs.mp4:实际渲染的 12 秒白模视频,无字幕、时间码或调试文字遮挡,兼容普通播放器。
– build_scene.py:能重建场景和动画的完整脚本。
– scene_spec.json、camera_path.json:记录读图结果,以及逐帧的成片时间、运动时间、人物位置、摄影机位置、朝向和焦距,便于核对空间与速度。
– contact_sheet.png:至少 12 个带时间标记的关键帧,单独用于验收,不烧录进视频。
– check_report.md:记录实际检查过的内容、修复项和未完成项。
请在同一项任务内自行完成环境连接、读图、建模、动作、运镜、检查和导出,只有上述必要环境操作才需要我介入。渲染任务较长时分段执行并查询完成情况。连接或导出失败时先自行诊断修复,仍无法继续才说明具体缺口并保留工程及恢复记录;只有脚本或截图时,不能声称视频已完成。
12 秒的镜头从前院跟进厂房,经过越障和一圈环绕,再从另一扇门出去,人物动作与空间关系有了可以直接观看的参照。对照轨迹文件,5 到 8 秒确实完成了 360° 环绕,慢动作也有连续的时间变化,作为拍摄预演,已经能检查镜头怎么走、动作放在哪。
接下来我们用白模来生成视频,我用的是seedance 2.5。
提示词:
请以本次上传并指定的白模预演视频为动作、空间布局、摄影机路线和速度节奏的参考,生成一段 12 秒、16:9 的写实滑板广告短片,一镜到底。
主角是同一位成年滑板手,穿酒红色宽松夹克、深灰工装裤、米白板鞋,戴黑色头盔;滑板为浅木色板面和黑色轮子。人物面貌、服装、身体比例及滑板外观全片保持一致,不添加其他主角。
场景是一座改造成滑板练习场的旧工业厂房:前院是浅灰水泥地,内部保留混凝土立柱、裸露钢梁和高处采光窗,天井洒入傍晚暖光。补充墙面磨损、轮胎印、少量浮尘与自然反光。人物和滑板的细节清楚,避免用过暗画面或浓烟遮住动作。
严格沿用参考中的前院、门 A、厂房、立柱、低矮障碍、门 B、天井的相对位置和尺度,保留绕柱方向、越障位置与两次穿门过程。新增材质和细节不能堵住原有通道,镜头变化时建筑结构保持一致。
动作和镜头按参考视频的时间顺序执行:
0—2 秒,贴地追拍脚部与后轮,两次蹬地加速接近入口。
2—4 秒,跟随进入厂房,绕柱转向,身体倾斜、双臂保持平衡。
4—5 秒,靠近障碍、屈膝压板蓄力。
5—8 秒,腾空越障的慢动作,同时沿参考路线完成围绕人物的连续 360° 环绕。
8—10 秒,恢复正常速度,四轮落地、屈膝缓冲,再加速驶向出口。
10—12 秒,通过出口进入天井,镜头在建筑外抬高,人物、门洞和厂房外立面同框。
保留参考视频中镜头高度、前后景遮挡关系、环绕方向和速度变化。全片动作连续,人和滑板的运动一致,脚踩板和轮子接地清楚可见。不要切镜头、瞬移、更换场景,或用重复帧和长时间空中悬停代替慢动作;不要把 360° 环绕改成画面自身旋转。
保持写实摄影质感,暖色夕阳与略冷的室内阴影形成层次。高速段有自然运动模糊,慢动作段能看清脚、板和障碍的相对位置。音效以滑轮、蹬地、落板和室内回声为主,无对白、字幕、品牌 Logo 或额外片头片尾。
把白模和生成的视频放在一起看,效果就很直观了。人物从室外进门、绕过柱子,再到起跳越障,基本沿着白模里的安排推进。最值得看的是中间那段环绕:镜头绕着腾空的人物转过一圈,衣服、滑板和动作还能接上,随后继续出门,最后抬高镜头收尾。前面在 Blender 里安排的路线、动作和镜头,在成片里都有了对应。
总结:这轮测下来,开头提到的几个升级方向,确实有了能看的见的成果。
设计图里的空间关系被用来搭建工地,封路通知进入了机器人调度,扫描件修订和财报脚注也影响了最终计算。
再到可编辑的 PPT、带公式的 Excel,以及能继续生成视频的白模预演,豆包已经能把多模态理解用到一整项任务里。
02. 一些分享
我觉得豆包这次升级最优秀的点,是能把看图、理解要求和制作成品接起来。
AI 编程和 Agent 进入实际业务,面对的往往是混在一起的图纸、表格、文档和软件操作。团队需要把这些材料整理成明确要求,再做出能演示、能修改、能交付的成果,这中间有不少重复工作。
做视频的友友们,可以重点看看白模那组。先在 Blender 里把人物怎么走、镜头怎么绕安排出来,生成预演后,再交给 Seedance 补上人物、材质和光影,让这套做法的价值很直观。
友友们想测试,可以挑一件手头正在做的事:比如把带批注的 PPT 和源表一起交过去,写清要改哪里、哪些内容要保留,看看交付能完成到什么程度。
用自己的材料跑一遍,也更容易判断豆包能帮上哪些忙,以及最后还需要自己补多少工作。
原文链接:Seed 2.1 Pro 升级实测,7 个高难度任务,看懂豆包这次的发力点




