动作捕捉技术,追根溯源可以到100年前,迪斯尼制作《白雪公主和七个小矮人》动画时,通过手绘的方式将人体的动作转移到动画人物上。现代意义的动作捕捉技术最早可以追述到上个世纪八十年代,MIT研发了光学动捕雏形,到了九十年代具有牛津大学背景的英国公司Vicon推出了成熟的商业光学动捕解决方案,成为光学动捕领域的行业巨头。惯性动捕,也是现在动作捕捉的另一个主流分支,技术原型出现于上个世纪90年代,并于2000s左右由荷兰的Xsens公司发扬光大,成为惯性动捕领域的巨无霸。最后一个现代主流技术就是无标记视觉动捕(或AI动捕),该技术由微软于2010年提出,并且随着深度学习的不断发展,最近几年也越来越成熟,此技术和前面两个技术的主要区别就是无需要昂贵的动作捕捉设备,需要的仅仅只是普通的家用相机,以及固定相机的三脚架,就可以通过AI模型分析输入的RGB影相来估算3D人体姿态。这三大类动捕的技术原理差异较大,下面分别简要介绍不同技术的特点。

光学动捕,顾名思义是利用光来进行人体及物体的动作捕捉。动捕演员需要在全身贴上光学标记点(Marker),用于反射红外光。捕捉面部表情时,也会在面部打上微型反射点(或结合头戴式摄像机系统)。表演时,四周的红外摄像机会持续捕捉标记点反射回来的光信号,再通过空间三角化解算(一种基于空间投影的数学计算方法),计算出各个标记点在3D空间中的毫米级精准位置。由于光学动捕本质上跟踪的是空间标记点,因此它的应用非常灵活,除了人体外,还可以对狗、武器、载具等任何贴点物体进行追踪。不过其主要缺陷在于成本高昂,搭建一个大型高规格的专业光学动捕棚,硬件与系统初期投入往往可达上千万元人民币,后期每年的软件授权与设备维护成本也相当可观。

惯性动捕,主要是让动捕演员佩戴惯性测量单元(IMU)来进行动作捕捉。IMU类似于光学动捕的标记点,但不需要那么密集。每个 IMU 都是带电池的小型无线传感器,佩戴在演员的主要骨骼部位(如大腿、小腿、前臂、躯干等)。IMU可以实时测量人体各个部位的加速度、角速度(旋转)以及地磁方向。数据发送给后台后,经过正逆运动学(FK/IK)及积分算法解算,就能推算出人体在3D空间中的骨骼运动姿态。相比光学动捕,惯性动捕最大的优势是没有视觉遮挡问题,不受场地光线限制,且设备轻巧便携,可随时随地穿戴开拍。但其缺点也很明显:绝对位置精度在厘米级,长时间录制容易产生累积漂移(如脚底打滑),且极易受到环境磁场(如钢筋结构、铁质道具)的干扰。目前入门级设备售价约为3~5万元人民币,而专业高阶设备在30万元人民币以上。

AI动捕,又称无标记视觉动捕,直接利用普通相机进行单视角或多视角的动作录制,然后通过AI模型分析视频,最终还原成3D动作。近十年来,随着深度学习的崛起,AI动捕迎来了爆发式发展。首先,2015年诞生的SMPL参数化人体模型成为了学术界人体建模的标杆。它用10个体型参数定义身材形态,72个姿态参数定义动作(基于24个骨骼关节),建立了统一的动作表达与提取标准。在技术路径上,传统方案多依赖2D关节点识别与多视角空间三角化;而端到端(End-to-End)方法,如基于体素(Voxel)的方案,则跳过显式2D匹配,直接在3D特征空间中建模,计算开销稍大但准确率更高。最新的前沿工作如 MAMMA,更是跳过了传统三角化与稀疏关节点提取,第一步改用基于512点的稠密人体结构来捕捉表面的丰富细节,再通过二阶段的类牛顿法高效拟合 SMPL 标准模型,达到了当下的 SOTA效果。

相比于光学与惯性动捕动辄数万乃至上千万元的部署门槛,AI动捕展现出了极具突破性的成本优势——利用现有智能手机等消费级设备拍摄,硬件成本甚至可控制在数百元以内。这种巨大的成本优势,使 AI动捕极其契合小批量、高频次的动作捕捉需求。特别是在游戏的前期概念与创意阶段,研发团队需要进行大量快速试错,并制作大量占位符(Placeholder)动作。此类动作大多不进入最终的正式发布版本,对绝对精度的要求相对宽松,AI动捕的输出质量完全能够满足需求。如果说传统的光学与惯性动捕是高精度交付的“量产正规军”,那么AI动捕就是快速验证创意的“敏捷游击队”,两者在不同研发周期中各司其职。今年,我们针对某一在研项目,快速落地了一套极轻量化的AI动捕解决方案:仅依托一间普通会议室、数台测试手机与三脚架,并专门去华强北定制了一根手机摄像控制器,实现了多视角的硬件级同步录制,同时配套开发了自动化视频同步与传输工具。整套系统仅用时两周便完成了搭建并正式启用。运行至今,该方案极大释放了前期创意的生产力,平均每月可稳定产出100+动作,高峰期月产出更突破200+。这一成功实践给了我们极大信心,未来我们将持续挖掘 AI动捕在游戏研发管线中的更多潜力。

动作捕捉只是动作制作管线的第一步。数据捕捉完成后,通常还需要经过重定向(Retargeting)、逻辑清理(Cleaning)和风格精修(Polishing)三个关键步骤,才能最终交付给动画或游戏使用。

  • 重定向:旨在将真人演员的动作数据映射到3D角色模型上。现实演员的身体比例与艺术作品中的角色通常存在差异,直接硬套必然导致肢体拉伸或变形。这也解释了为什么优秀的动捕演员是“老天爷赏饭吃”——他们具备极佳的艺术比例与肢体协调性,其动作在重定向后的修补成本要低得多。
  • 逻辑清理:主要是修复数据中的客观瑕疵,如抖动、滑步(Foot Sliding)、肢体穿模等,使动作符合基本的物理常识与人体力学,消除视觉歧义。
  • 风格精修:则是将游戏或电影的独特艺术风格注入动作之中。“美”没有标准答案,工作量完全取决于主创团队的审美预期。这一阶段的不确定性极高,通常是“有多少预算就能消耗多少预算”的品效无底洞。

从商业模式来看,动捕团队要想实现盈利,必须走向规模化与极致的设备利用率,只有让动捕棚保持高频运转才能挤出利润空间。前期的动捕采样大多是标准化服务,利润差异不大,真正的核心收益与成本壁垒在于后续的数据修改与处理能力。在粗修阶段,如何利用自动化技术快速批量修复跳变、滑步和穿模等客观问题,是规模化动捕团队的绝对核心壁垒。这极其依赖样本量的沉淀——正如全国最好的肛肠科大夫往往在川渝地区一样,案例见得足够多,经验与自动化规则库自然更成熟。到了精修阶段,由于缺乏统一标准,极大程度依赖游戏主美或导演的主观偏好,因此这部分工作通常由项目组内部消化,或外包给擅长特定风格的精修团队,传统的动捕服务商很难在此赚取高溢价。我曾见过一个典型的案例:一家海外中小型游戏工作室,在 3~4 年前盲目购置了一套 300 平米的高规格光学动捕棚。最终因产能无法消化而长期空转,无法产生预期价值,近期只能将其作为不良资产低价处置。从 ROI(投资回报率)的角度来看,此类固定资产在立项之初就应当极为审慎。

以上是我对动捕工业化管线的一些洞察与思考。未来将持续在动作管线领域深耕,打造出真正能为游戏研发降本增效的动作生产力工具。