一、时代背景:摄影的第三个范式

1.1 从记录光线到计算像素,再到重建世界

回顾我们这100天的旅程:

今天,我们站在第四个范式的入口:"重建世界"

不再是拍一张照片告诉你"世界长这样",而是拍一组照片让你"走进去"。

1.2 一个不可能的时间线

年份 里程碑 耗时
2020 NeRF论文发表(Ben Mildenhall等)
2022 Instant-NGP(NVIDIA),训练时间从天级降到秒级 2年
2022 Apple Object Capture API,手机3D扫描 同年
2023 3D Gaussian Splatting(Kerbl等),实时渲染 1年
2024-25 ILM将NeRF用于漫威《Ironheart》特效制作 2年
2025 VGGT获CVPR最佳论文,单次前向传播完成3D重建 1年
2026 VGGT-Ω和D4RT获得CVPR 2026最佳论文;ILM+Nerfstudio获HPA技术创新奖 1年

从论文到好莱坞特效,只用了5年。 这个速度在摄影史上前所未有。

1.3 为什么是"摄影"的事?

你可能觉得这是计算机图形学的事,跟摄影无关。但请记住:

摄影师拍下的每一张照片,都可能成为3D世界的一个数据点。 这不是"取代摄影"——这是"赋予摄影新的维度"。


二、核心技术里程碑:五步改变一切的算法

2.1 NeRF——神经辐射场(2020)

论文:Ben Mildenhall, Pratul P. Srinivasan, Matthew Tancik等, "NeRF: Representing Scenes from a Single Viewpoint Using Neural Radiance Fields", ECCV 2020 Best Paper Honorable Mention

核心思想:用一个神经网络(多层感知机MLP)来表示整个3D场景。网络的输入是空间坐标(x, y, z)和观察方向(θ, φ),输出是该点的颜色(r, g, b)和体积密度σ。

一句话解释:传统3D建模用三角面片(mesh)描述物体表面,NeRF用一个"函数"描述整个空间——空间中每个点有什么颜色、有多"密"。

NeRF技术流程示意:从多角度输入图像到优化神经辐射场,再到渲染全新视角——照片进,3D世界出
NeRF技术流程示意:从多角度输入图像到优化神经辐射场,再到渲染全新视角——照片进,3D世界出

为什么震撼?

为什么慢?

2.2 Instant-NGP——秒级训练(2022)

论文:Thomas Müller, Alex Evans, Christopher Schied, Alexander Keller(NVIDIA), "Instant Neural Graphics Primitives with a Multiresolution Hash Encoding", SIGGRAPH 2022 Best Paper

核心突破:用多分辨率哈希编码(multiresolution hash encoding)替代NeRF原始的位置编码。

效果

Thomas Müller是NVIDIA的研究科学家,这篇论文让NeRF从"有趣但无用"变成了"有趣且有用"。它是整个3D影像革命的加速器。

2.3 3D Gaussian Splatting——当点变成椭球(2023)

论文:Bernhard Kerbl, Georgios Kopanas, Thomas Leimkühler, George Drettakis, "3D Gaussian Splatting for Real-Time Radiance Field Rendering", SIGGRAPH 2023 Best Paper

核心思想:不再用神经网络的隐式表示,而是用数百万个3D高斯椭球来表示场景。每个高斯椭球有:

渲染方式:把所有高斯椭球投影到2D图像平面上,按深度排序,alpha混合。这就是"splatting"(溅射/投射)的由来。

3D Gaussian Splatting渲染效果对比:左侧为彩色高斯点云模型,右侧为最终渲染的写实效果图,从数百万个椭球到照片级画面
3D Gaussian Splatting渲染效果对比:左侧为彩色高斯点云模型,右侧为最终渲染的写实效果图,从数百万个椭球到照片级画面

为什么比NeRF更快?

为什么对摄影重要?

2.4 VGGT——一次前向传播完成3D重建(2025)

论文:Visual Geometry Grounded Transformer, Oxford VGG + Meta AI, CVPR 2025 Best Paper

核心突破:不再需要迭代优化,用一个Transformer网络一次前向传播就能从1到数百张照片中预测:

速度:约0.2秒(单块H100 GPU),无需任何优化循环。

意义:这相当于把传统摄影测量(SfM/MVS,需要COLMAP跑几十分钟到几小时)的工作压缩到了一次神经网络推理。

2.5 D4RT——动态4D重建(2026)

论文:Dynamic 4D Reconstruction and Tracking, Google DeepMind + Oxford + UCL, CVPR 2026 Best Paper

核心突破:在VGGT的基础上加入时间维度。不仅重建3D空间,还追踪每个点在时间上的运动——实现4D重建(3D空间+1D时间)。

关键数据

对摄影的启示:这意味着你拍的一段视频,AI可以在几秒内重建出完整的4D时空——每个像素在每个时刻的3D位置。


三、作品赏析:当照片变成可以走进去的世界

作品1:NeRF原始论文的经典对比(2020)

NeRF原理示意:用神经网络学习空间中每一点的颜色和密度,输入是多个角度的照片,输出是可以从任意视角渲染的3D场景
NeRF原理示意:用神经网络学习空间中每一点的颜色和密度,输入是多个角度的照片,输出是可以从任意视角渲染的3D场景

Ben Mildenhall等人的原始论文中,最令人震撼的是对比图:左边是输入的50-100张照片,右边是从NeRF中渲染出的全新视角——这些视角从未被任何相机拍摄过,但看起来完全真实。

技术细节

历史意义:第一次证明"神经网络可以学会一个完整的3D场景"。这比任何摄影测量算法都更优雅——不需要特征点匹配、不需要三角化、不需要光束法平差。一个MLP就够了。

作品2:Instant-NGP的"秒级奇迹"(2022)

Thomas Müller的Instant-NGP论文中有一张经典对比图:同一场景,原始NeRF训练24小时的结果 vs Instant-NGP训练5秒的结果——后者在SSIM指标上甚至略优。

这意味着什么?

作品3:Nerfstudio——开源3D重建平台

Nerfstudio界面:开源NeRF训练和可视化工具,左侧是训练中的3D场景预览,右侧是参数控制面板
Nerfstudio界面:开源NeRF训练和可视化工具,左侧是训练中的3D场景预览,右侧是参数控制面板

Matt Tancik(UC Berkeley / Google)在2022年创建了Nerfstudio——一个完全开源的NeRF/3DGS工具包。它把散落在各个论文仓库中的代码整合成了一个统一的、易用的平台。

为什么重要?

作品4:ILM《Ironheart》——NeRF进入好莱坞(2024-2026)

漫威《Ironheart》剧中的机械战甲场景,ILM利用NeRF技术重建了芝加哥城市环境,实现了传统CG无法比拟的真实感
漫威《Ironheart》剧中的机械战甲场景,ILM利用NeRF技术重建了芝加哥城市环境,实现了传统CG无法比拟的真实感

这是NeRF技术最引人瞩目的工业应用案例。

背景:漫威Disney+剧集《Ironheart》(钢铁之心)中有大量无人机拍摄的芝加哥城市镜头。导演要求以超过1000%的速度重放这些镜头——但高速重放暴露了原始素材的相机抖动问题。

传统方案:用CG重建整个芝加哥——需要数月时间和巨额预算。

创新方案:视觉特效总监Vincent Papaix发现了Nerfstudio。他用无人机照片训练了NeRF模型,重建了芝加哥天际线的3D环境。然后可以:

他们以为不可能用原始素材改变相机运动。但我们做到了。他们说这像魔法一样。没有建模,没有任何传统CG。 ——Vincent Papaix, ILM

结果:2026年3月,ILM和Nerfstudio因此获得HPA(好莱坞专业协会)技术创新奖

Matt Tancik的评价:"几年前这还是科学论文。现在它正在进入我们使用的所有软件。"

作品5:Apple Object Capture API——手机上的3D扫描(2022-2026)

Apple Object Capture API界面:iPhone上通过围绕物体拍摄多张照片,结合LiDAR数据,自动生成高保真3D模型
Apple Object Capture API界面:iPhone上通过围绕物体拍摄多张照片,结合LiDAR数据,自动生成高保真3D模型

2022年WWDC,Apple发布了Object Capture API——开发者可以用iPhone拍摄一组照片(配合LiDAR传感器),自动在设备端生成3D模型。

2026年最新进展(iOS 17+):

KIRI Engine等第三方App已经率先集成了这一API。用户只需围绕物体走动拍摄,就能得到一个可旋转、可缩放的3D模型。

摄影意义:你用手机拍一圈照片,就得到了一个3D模型。这是摄影测量(photogrammetry)在消费级设备上的终极形态。

作品6:VGGT的"单次推理"(2025)

CVPR 2025最佳论文VGGT展示了令人震惊的结果:

方法 相机位姿精度(AUC@30) 运行时间 需要优化?
COLMAP(传统SfM) ~90 几十分钟
DUSt3R 67.7-76.7 ~7秒 后处理
MASt3R 76.4-81.8 ~9秒 后处理
VGGT(前向传播) 85.3-88.2 ~0.2秒
VGGT + BA优化 91.8-93.5 ~1.8秒 微调

一句话:一个神经网络在0.2秒内完成的工作,传统摄影测量需要几十分钟。而且精度相当甚至更优。

作品7:Gaussian Splatting在文化遗产保护中的应用(2025-2026)

据《AI-Driven 3D Reconstruction for Cultural Heritage》(ISPRS Archives, 2026),多个欧洲博物馆已经开始使用Gaussian Splatting技术对文物进行3D数字化:

摄影意义:文化遗产的数字化保存不再需要数百万美元的激光扫描仪——一组照片+一台GPU就够了。

作品8:D4RT的4D重建——时间成为第四维度(2026)

D4RT技术示意:从一段视频中重建4D时空——每个像素在每个时刻的3D位置都被精确追踪,分离物体运动和相机运动
D4RT技术示意:从一段视频中重建4D时空——每个像素在每个时刻的3D位置都被精确追踪,分离物体运动和相机运动

Google DeepMind的D4RT在CVPR 2026获得最佳论文。它的创新之处在于:

对摄影的意义:你拍的一段视频,AI可以在几秒内重建出完整的4D时空模型。你可以:

这已经不是"照片"了。这是"可探索的时间切片"。


四、技术专题:3D影像的五层进化

4.1 传统摄影测量时代(1850s-2020)

特征 细节
核心算法 SfM(Structure from Motion)+ MVS(Multi-View Stereo)
代表工具 COLMAP, Agisoft Metashape, Pix4D
输出 稀疏/密集点云 → mesh → 纹理贴图
耗时 几十分钟到几小时
局限 难以处理反光、透明、弱纹理表面

摄影遗产:150年来,摄影测量的核心假设一直是"2D照片可以推断3D结构"。从立体镜到航空摄影测量,到如今的无人机测绘——一脉相承。

4.2 NeRF隐式表示时代(2020-2023)

特征 细节
核心创新 用神经网络隐式表示3D场景
代表方法 NeRF, Mip-NeRF, Nerfacto
优势 照片级渲染质量,完美处理反射
局限 训练慢(小时级),不可编辑,静态场景

摄影连接:NeRF的输入是摄影师拍的照片。摄影师的"构图能力"和"视角选择"直接决定了3D重建的质量。

4.3 Gaussian Splatting显式表示时代(2023-2025)

特征 细节
核心创新 用数百万个3D高斯椭球显式表示场景
代表方法 3DGS, Mip-Splatting, 2DGS
优势 实时渲染(100+fps),可编辑,训练快
局限 内存占用大(数百万高斯),新视角合成质量略低于NeRF

摄影连接:Gaussian Splatting可以编辑——这意味着摄影师可以"修改"重建后的3D场景:删除干扰物、改变光照、调整构图。

4.4 前向传播重建时代(2025-2026)

特征 细节
核心创新 单次神经网络前向传播完成3D重建
代表方法 VGGT, VGGT-Ω, D4RT
优势 亚秒级速度,精度媲美传统方法
局限 需要大量训练数据,泛化能力待验证

摄影连接:这意味着3D重建不再是"后处理"——可以是"实时"的。你拍的照片,瞬间变成3D模型。

4.5 生成式3D时代(2026-)

特征 细节
核心创新 从文本/图像直接生成3D场景
代表方法 DreamFusion, Zero-1-to-3, SV3D
优势 不需要照片输入,纯想象即可
局限 质量和一致性仍在提升中

摄影连接:这可能意味着——即使你不拍照,AI也能根据你的文字描述"生成"一个3D世界。但这恰恰让真实照片变得更珍贵——因为它是唯一的"真实数据源"。


五、关键人物谱系

学术先驱

人物 机构 贡献
Ben Mildenhall Google Research NeRF论文第一作者,ECCV 2020
Matthew Tancik UC Berkeley NeRF核心作者,Nerfstudio创建者
Thomas Müller NVIDIA Instant-NGP,SIGGRAPH 2022 Best Paper
Bernhard Kerbl Université Côte d'Azur 3D Gaussian Splatting,SIGGRAPH 2023 Best Paper
Andrea Vedaldi Oxford VGG VGGT核心作者,CVPR 2025 Best Paper

工业推动者

人物/团队 机构 贡献
Vincent Papaix ILM 将NeRF引入好莱坞特效制作
George Drettakis Université Côte d'Azur Gaussian Splatting合作者
Pix4D工程团队 Pix4D 将Gaussian Splatting集成到生产级测绘工具
Apple Vision团队 Apple Object Capture API,让3D扫描走进手机

传承关系

Marc Levoy(光场相机/计算摄影)

└─ Ren Ng(Lytro光场相机)

└─ Ben Mildenhall(NeRF第一作者)

└─ Matthew Tancik(Nerfstudio)

└─ Vincent Papaix / ILM(好莱坞应用)

传统摄影测量(COLMAP/SfM)

└─ Johannes Schönberger(COLMAP作者)

└─ VGGT / D4RT(用Transformer替代传统SfM)

NVIDIA图形学

└─ Thomas Müller(Instant-NGP)

└─ 3D Gaussian Splatting社区


六、思考题

1. 当照片可以"走进去","拍照"这个动作的意义发生了什么变化?

传统摄影中,你按一次快门得到一张照片。现在,你拍一组照片得到一个3D世界——观者可以自由选择视角。这是否意味着"摄影师"的角色从"构图者"变成了"世界建造者"?当观者可以自由移动视角,摄影师还有"控制权"吗?

2. NeRF/Gaussian Splatting是"摄影的终结"还是"摄影的升华"?

乐观观点:这赋予了照片前所未有的表达能力——一张照片是一个窗口,一组照片是一个世界。

悲观观点:当AI可以从几张图片"脑补"出完整3D场景,照片作为"真实记录"的价值将被稀释。

你的判断是什么?

3. 如果你的手机可以在按下快门的瞬间生成3D模型,"照片"和"模型"的边界在哪里?

Apple的Object Capture API已经让手机可以拍几张照片就生成3D模型。Vision Pro的Spatial Video已经在记录3D空间。未来,你拍的不是"一张照片"——而是一个"可探索的时空切片"。到那时,"摄影"这个词还够用吗?


七、总结:从达盖尔到NeRF,187年的圆环

1839年,达盖尔用银版法把三维世界变成了二维影像。这是一个降维的过程——丢失了深度信息,但获得了可复制、可传播的影像。

2020年,NeRF把二维影像重新变回三维世界。这是一个升维的过程——从照片中恢复了深度信息,甚至"脑补"出了从未被拍摄过的视角。

187年,摄影走了一个圆环:从3D世界→2D影像→3D世界。

但这不是简单的回归。在这个圆环中,摄影获得了:

而我们——作为摄影师——获得了一个前所未有的选择:

是继续拍2D照片?还是开始"拍"3D世界?

答案可能不是二选一。答案可能是:两者都是摄影。只是维度不同。


延伸阅读


Day_98已完成