ICLR 2026. [Paper] [Page] [Github]
Sherwin Bahmani, Tianchang Shen, Jiawei Ren, Jiahui Huang, Yifeng Jiang, Haithem Turki, Andrea Tagliasacchi, David B. Lindell, Zan Gojcic, Sanja Fidler, Huan Ling, Jun Gao, Xuanchi Ren
NVIDIA | University of Toronto | Vector Institute | Simon Fraser University
23 Sep 2025

Introduction

본 논문은 reconstruction과 생성이라는 두 가지 패러다임을 generative 3D scene reconstruction이라는 개념을 통해 연결하였다. 본 논문에서는 video diffusion model의 latent 표현으로부터 한 번의 forward pass로 명시적인 3D 환경을 생성하는 새로운 방법인 Lyra를 소개한다.

Lyra는 self-distillation 프레임워크에서 학습되며, 3DGS 디코더가 video diffusion model의 latent space에서 직접 작동한다. 입력 이미지 또는 동영상이 주어지면, 카메라 궤적을 조건 입력으로 샘플링하고, 동영상 latent를 denoising한 후, 두 개의 병렬 branch를 따라 디코딩한다. 첫 번째 branch는 표준 RGB 디코더를 사용하여 동영상 시퀀스를 합성하고, 두 번째 branch는 명시적인 3D 표현을 생성하는 3DGS 디코더이다. 이 두 branch는 RGB branch가 3DGS branch를 지도하는 self-distillation 프레임워크를 구성한다. 시점 범위를 확장하기 위해 여러 카메라 궤적을 샘플링하고, 여러 동영상 latent를 생성하며, 장기적인 불일치 및 멀티뷰 불일치를 완화하면서 이러한 데이터 간의 정보를 융합하도록 3DGS 디코더를 학습시킨다.

이 프레임워크는 세 가지 주요 이점을 제공한다.

  1. 실제 멀티뷰 캡처 없이 video diffusion model에서 직접 다양한 시나리오를 포괄하는 대규모 합성 환경을 생성할 수 있다.
  2. 동영상 모델의 latent space에서 작동하므로 과도한 메모리 오버헤드 없이 여러 시점을 효율적으로 처리할 수 있다.
  3. 명시적인 3DGS 출력은 geometry 일관성을 보장하여 후속 작업에 직접 적용할 수 있는 표현을 제공한다.

결과적으로 Lyra는 inference 시 추가적인 최적화나 후처리 없이 monocular 입력에서 실시간 렌더링을 지원하는 고품질 3D Gaussian 장면을 생성한다.

본 논문에서는 이러한 self-distillation 프레임워크를 monocular 동영상으로부터의 동적 4D 생성으로 확장하였다. 이 설정에서 동영상 모델은 시공간적 supervision을 제공하고, 학생은 동적 장면의 novel view synthesis를 가능하게 하는 시간 조건부 3DGS 표현을 생성하는 방법을 학습한다.

Method

1. Self-Distillation

본 논문에서는 카메라 제어 video diffusion model $\mathcal{V}$를 teacher로 하는 teacher-student 패러다임 하에서 3DGS 디코더 \(\mathcal{D}_s\)를 student로 학습시켰다. 다양한 supervision을 위해, GPT-5로 다양한 텍스트 프롬프트 세트를 구축하고, Flux를 사용하여 이미지 $I$를 생성하며, GEN3C를 사용하여 멀티뷰 시퀀스로 확장한다.

Teacher–student 설정

입력 이미지 $I$와 샘플링된 카메라 궤적 \(\{\textbf{C}^t\}_{t=1}^L\)이 주어지면, video diffusion model $\mathcal{V}$는 denoising된 동영상 latent $\textbf{z}$를 생성한다.

\[\begin{equation} \textbf{z} = \mathcal{V}(I, \{\textbf{C}^t\}_{t=1}^L) \end{equation}\]

$\textbf{z}$는 두 가지 branch를 통해 디코딩된다. 사전 학습된 RGB 디코더 \(\mathcal{D}_\textrm{rgb}\)는 동영상 프레임 \(\textbf{I}_{\mathcal{D}_\textrm{rgb}}\)를 생성하고, 3DGS 디코더 \(\mathcal{D}_s\)는 명시적인 3D Gaussian $\textbf{G}$를 출력한다. 3DGS에서 렌더링된 뷰 \(\textbf{I}_{\mathcal{D}_s}\)는 \(\textbf{I}_{\mathcal{D}_\textrm{rgb}}\)와 일치하도록 self-distillation 루프를 형성한다.

\[\begin{equation} \textbf{I}_{\mathcal{D}_\textrm{rgb}} = \mathcal{D}_\textrm{rgb}(\textbf{z}), \quad \textbf{I}_{\mathcal{D}_s} = \textrm{Render}(\textbf{G}, \{ \textbf{C}^t\}_{t=1}^L) \end{equation}\]
다중 궤적 supervision

본 논문에서는 입력 이미지의 시점 범위를 확장하기 위해 입력 이미지당 $V = 6$개의 카메라 궤적을 샘플링한다. 각 궤적 $v$에 대해 시공간 캐시 \(\{\textbf{P}^{t,v}\}_{t=1}^L\)과 $L = 121$개의 카메라 포즈 \(\{\textbf{C}^{t,v}\}_{t=1}^L\)을 구성한다. 이러한 캐시를 $\mathcal{V}$에 통과시키면 latent \(\textbf{z}^v\)가 생성되고, teacher 모델은 이를 RGB 프레임 \(\textbf{I}_{\mathcal{D}_\textrm{rgb}}^v\)로 디코딩한다.


3DGS 디코더 \(\mathcal{D}_s\)는 가려진 영역을 채우면서 이러한 여러 $\textbf{z}^v$를 일관된 Gaussian $\textbf{G}$로 융합하는 방법을 학습한다. 이러한 self-distillation 디자인을 통해 \(\mathcal{D}_s\)는 $\mathcal{V}$에서 제공하는 합성 supervision만으로 완전히 학습된다. Latent space에서의 작동은 여러 궤적의 효율적인 통합을 가능하게 하며, 명시적인 Gaussian 출력 $\textbf{G}$는 geometry 일관성을 보장하고 후속 시뮬레이션 및 실시간 렌더링을 지원한다.

2. 3DGS 디코더

Latent 기반 3D reconstruction을 scaling

기존의 feed-forward reconstruction 프레임워크는 각 픽셀에 대해 3D Gaussian을 생성하므로, 처리할 수 있는 입력 뷰의 수와 해상도에 한계가 있다. 본 논문에서 제안하는 동영상 모델은 704$\times$1280 해상도의 입력 뷰 726개를 합성할 수 있는데, 이는 기존 방법의 처리 용량을 훨씬 뛰어넘는 것으로 GPU 메모리 한계를 초과한다. 병목 현상은 비주얼 토큰에 적용되는 attention 메커니즘에 있으며, 이 메커니즘의 메모리 및 연산 요구 사항은 픽셀 수에 따라 증가한다. 이러한 한계를 극복하기 위해, 본 논문에서는 픽셀 공간에서의 확장을 피하고, 카메라 제어 video diffusion model에서 생성된 압축된 동영상 latent space에서 직접 연산을 수행하여 멀티뷰 동영상 latent $\textbf{Z} \in \mathbb{R}^{V \times L^\prime \times C \times h \times w}$를 얻었다.

아키텍처

3DGS 디코더 \(\mathcal{D}_s\)는 먼저 입력을 reconstruction block의 hidden dimension으로 매핑하고 per-pixel 3D Gaussian feature \(\textbf{G} \in \mathbb{R}^{V \times L \times H \times W \times 14}\)를 출력한다. 구체적으로, 입력은 $\textbf{Z}$와 인코딩된 Plücker embedding $\textbf{E}$이며, 둘의 차원이 같다. 전체 아키텍처는 다음과 같이 작동한다.

  1. $\textbf{Z}$와 $\textbf{E}$를 reconstruction block의 hidden dimension과 일치하도록 patchify한다. 추가적인 비전 인코더는 필요하지 않으며, flatten된 토큰으로 변환하는 2$\times$2 patchification layer만 필요하다.
  2. Patchify된 입력을 더한다.
  3. Reconstruction block은 Long-LRM의 디자인을 따른다. 하나의 block은 하나의 Transformer layer와 그 뒤에 오는 7개의 Mamba-2 layer로 구성된다. 이 block을 두 번 반복하여 16개의 layer와 512 hidden dimension을 얻는다.
  4. Transposed 3D convolution은 hidden 표현을 14개의 Gaussian 채널 (3D 위치, scale, rotation quaternion, 불투명도, RGB)로 매핑한다.
Plücker embedding

먼저 카메라 포즈 \(\{\textbf{C}^{t,v}\}\)와 intrinsic으로부터 Plücker embedding \(\textbf{E}^\textrm{raw} \in \mathbb{R}^{V \times L \times 6 \times H \times W}\)를 계산한다. 사전 학습된 VAE에서 사용된 RGB 인코더 $\mathcal{E}$를 재사용하여 Plücker embedding을 인코딩한다. 구체적으로, $\mathcal{E}$를 사용하여 광선 방향 $\textbf{d} \in \mathbb{R}^3$와 광선 방향 및 광선 원점의 외적 $\textbf{d} \times \textbf{o} \in \mathbb{R}^3$을 각각 인코딩하고, 채널 차원을 따라 concat하여 \(\mathbf{E}^\textrm{enc} \in \mathbb{R}^{V \times L^\prime \times 2C \times h \times w}\)를 얻는다. 가벼운 MLP로 \(\mathbf{E}^\textrm{enc}\)를 $\textbf{E} \in \mathbb{R}^{V \times L^\prime \times C \times h \times w}$로 매핑하여 채널 차원을 절반으로 줄인다.

3. Loss Function

이미지 기반 reconstruction loss

이미지 기반 reconstruction loss는 MSE loss \(\mathcal{L}_\textrm{mse}\)와 VGG를 사용하는 LPIPS loss \(\mathcal{L}_\textrm{lpips}\)로 나뉜다.

깊이 loss

RGB loss만으로 학습된 디코더는 종종 평면화된 geometry를 생성한다. 이를 해결하기 위해, ViPE로 추정한 일관된 동영상 깊이와 렌더링된 depth map 사이에 Long-LRM의 scale-invariant depth loss \(\mathcal{L}_\textrm{depth}\)를 적용한다.

불투명도 기반 pruning

Long-LRM과 유사하게, 불투명도에 L1 regularization \(\mathcal{L}_\textrm{opacity}\)를 적용하고 불투명도가 80% 미만인 Gaussian을 제거한다.

전체 loss

전체 loss는 모든 loss의 가중 합으로 계산한다.

\[\begin{equation} \mathcal{L} = \lambda_\textrm{mse} \mathcal{L}_\textrm{mse} + \lambda_\textrm{lpips} \mathcal{L}_\textrm{lpips} + \lambda_\textrm{depth} \mathcal{L}_\textrm{depth} + \lambda_\textrm{opacity} \mathcal{L}_\textrm{opacity} \end{equation}\]

(\(\lambda_\textrm{mse} = 1.0\), \(\lambda_\textrm{lpips} = 0.5\), \(\lambda_\textrm{depth} = 0.5\), \(\lambda_\textrm{opacity} = 0.1\))

4. Extension to Dynamic 3D Scenes

동적 장면을 위한 self-distillation

동적 3D 설정은 정적 3D 설정과 유사한 설계를 따른다. 단일 이미지 대신, 모델은 카메라 포즈가 포함된 길이 $L$의 동영상 1개를 입력으로 받아 동일한 모션을 포착하는 동영상 latent를 생성한다. 동영상 입력의 경우, 정적 경우와 유사한 프로토콜을 따른다. 즉, GPT-5로 다양한 텍스트 프롬프트를 샘플링한 다음, CosmosWan으로 동영상을 생성한다. 생성된 동영상에는 ViPE를 사용하여 카메라 포즈와 depth map이 주석으로 추가된다.

동적 3DGS 디코더 아키텍처

본 논문은 BTimer의 bullet-time 디자인을 따라, 동영상 프레임에 대해 시간 의존적인 3D Gaussian을 생성하는 동적 3DGS 디코더 \(\mathcal{D}_d\)를 설계한다. 구체적으로, \(\mathcal{D}_d\)는 정적 디코더 \(\mathcal{D}_s\)의 아키텍처를 거의 그대로 따르지만, 입력에 인코딩된 소스 및 타겟 시간 임베딩 \(\textbf{T}^\textrm{src}, \textbf{T}^\textrm{tgt} \in \mathbb{R}^{V \times L^\prime \times C \times h \times w}\)를 추가한다.

소스 시간 \(\textbf{T}^\textrm{src,raw} \in \mathbb{R}^{V \times L \times 1 \times H \times W}\)와 타겟 시간 \(\textbf{T}^\textrm{tgt,raw} \in \mathbb{R}^{V \times 1 \times 1 \times H \times W}\) 모두 공간적으로 반복되고 2D 사인파 임베딩으로 증강되어 채널 차원이 3으로 확장된 후, RGB 인코더 $\mathcal{E}$를 사용하여 인코딩된다. 타겟 시간은 latent 시간 차원을 따라 $L^\prime$번 반복된다.

학습 과정에서 타겟 시간이 무작위로 샘플링되고, 해당 3D Gaussian이 디코딩되어 data augmentation으로 생성된 모든 궤적에 걸쳐 학습된다. 사전 학습된 \(\mathcal{D}_s\)에서 \(\textbf{T}^\textrm{src}\)와 \(\textbf{T}^\textrm{tgt}\)의 patchification layer를 0으로 초기화하고 \(\mathcal{D}_d\)를 fine-tuning한다. \(\textbf{T}^\textrm{src}\)와 \(\textbf{T}^\textrm{tgt}\)는 $\textbf{Z}$와 $\textbf{E}$의 합에 직접 더해진다.

Data augmentation

시간이 중요한 요소가 아닌 정적 3D 장면에서는 서로 다른 timestep의 프레임을 모두 3DGS 렌더링을 학습에 사용할 수 있다. 그러나 동적 3D 장면에서는 3DGS가 시간에 따라 변화하므로 해당 timestep의 프레임만 유효하다. 이러한 제약으로 인해 특정 timestep의 3DGS가 다른 timestep의 프레임 정보를 무시하는 단순한 해결책이 나올 수 있다.


이 문제를 해결하기 위해 timestep 간 supervision의 균형을 맞추는 data augmentation 전략을 도입하였다. 초기 프레임은 입력 이미지에 가까운 시점과 자연스럽게 연관되는 반면, 후기 프레임은 더 먼 시점에 해당한다. 이러한 불균형을 해소하기 위해 각 timestep에 대해 가까운 시점과 먼 시점의 쌍으로 된 뷰를 학습 데이터에 추가한다.

구체적으로, 입력 동영상의 프레임 순서를 반전시켜 $\mathcal{V}$에 입력하면 6개의 추가 멀티뷰 시퀀스가 ​​생성된다. 이러한 시퀀스를 원래의 움직임 순서로 되돌리면, 먼 시점에서 입력 방향으로 진행되는 6개의 궤적을 얻는다. 원래의 바깥쪽으로 향하는 6개의 궤적과 결합하면, 각 timestep당 12개의 뷰를 얻게 된다.

이러한 data augmentation은 학습 단계에서만 적용된다는 점이다. 역순으로 배열된 궤적은 pruning 과정에서 발생하는 아티팩트로 인한 데이터 붕괴를 방지하기 위한 추가적인 supervision 역할만 하며, inference 단계에서는 필요하지 않다.

Experiments

1. Main Results

다음은 SOTA와의 비교 결과이다.


다음은 생성된 3DGS 장면의 예시들이다.

2. Ablations

다음은 ablation 결과이다.