数字人作为智能交互的核心载体,其技术的创新突破对人工智能与数字经济的深度融合具有关键意义。本文聚焦于计算机视觉领域,围绕数字人技术的两大核心主题建模与驱动展开讨论,并系统整理相关数据集的特性及评估方法。在建模方面,研究从传统几何建模技术展开,涵盖基于网格优化、点云处理的精细化三维重建方法,进而探讨深度学习驱动的生成式建模新范式。在驱动方面,重点分析基于视频序列的人体姿态估计与表情迁移技术,以及结合音频特征的语音驱动口型同步生成算法。数据集的规模与多样性对数字人形象生成至关重要,评估方法的完善程度则能更客观地衡量生成效果。本文对数字人建模与驱动领域的代表性工作进行系统归类和总结,分析现有方法的优势与不足,并结合当前技术发展趋势,展望未来可能的研究方向。