우리는 디지털 기적의 시대에 살고 있습니다. 몇 번의 키 입력만으로 광활한 외계 행성의 풍경을 만들어내고, 역사적 인물을 되살리고, 한때 할리우드 예산이 필요했던 영화 같은 장면을 연출할 수 있습니다. AI 비디오 생성기는 현대판 마법 지팡이가 되었습니다. 하지만 진정으로 호기심 많은 창작자, 안목 있는 개발자, 그리고 미래지향적인 전략가에게는 마법 그 자체만으로는 충분하지 않습니다. 우리는 다음과 같은 질문을 던져야 합니다. 이 마법은 어떻게 작동하는 걸까요?
단순한 텍스트 상자와 "생성" 버튼 아래에는 무엇이 숨겨져 있을까요? 기계가 움직이는 영상으로 꿈을 꿀 수 있게 하는 근본적인 설계도는 무엇일까요? 이를 이해하는 것은 단순히 학문적인 탐구에 그치는 것이 아닙니다. 더 깊은 창의적 통제력을 확보하고, 업계의 미래를 예측하며, 시간과 비용을 투자할 도구에 대해 현명한 결정을 내리는 데 핵심적인 열쇠입니다.
이 글은 제품 리뷰나 순위표가 아닙니다. 기계의 심장부로 떠나는 탐험입니다. 5,000단어가 넘는 분량으로 텍스트-비디오 AI 모델 기술의 모든 것을 담은 완벽한 가이드에 오신 것을 환영합니다. 기초 개념부터 최첨단 연구까지, 복잡한 용어를 쉽게 풀어 설명하고 이 혁명을 이끄는 우아한 아이디어들을 공개합니다.
1장: 비약적인 발전 - 확산 모델의 승리: 모든 현대 생성형 AI의 핵심 개념과 기존 방식을 능가한 이유를 살펴봅니다.
2장: 비디오를 위한 재해석된 트랜스포머 혁명(DiT): Sora와 같은 모델의 핵심 아키텍처인 확산 트랜스포머에 대해 자세히 알아봅니다.
3장: 압축의 기술 - VAE 이해하기: 비디오 생성을 컴퓨팅 효율을 높이는 데 중요한 역할을 하는 변분 오토인코더(VAE)를 살펴봅니다.
4장: 무한 확장 - 전문가 혼합(MoE)의 천재성: 모델이 비용 증가 없이 엄청난 크기로 확장될 수 있도록 하는 영리한 기술에 대한 설명입니다.
5장: 아키텍처의 교향곡: 이러한 구성 요소들이 어떻게 결합되고, 각기 다른 배열 방식이 Sora, Kling, Wan 2.2와 같은 모델의 고유한 강점으로 이어지는지에 대한 전체적인 관점을 제시합니다.
이 책은 AI 비디오 생성 아키텍처에 대한 마스터 클래스입니다. 이제 블랙박스를 열어봅시다.
1장: 비약적인 발전 - 확산 모델이 승리한 이유
현재 위치를 이해하려면 먼저 과거를 이해해야 합니다. 수년간 생성형 AI 분야에서 지배적인 패러다임은 **생성적 적대 신경망(GAN)**이었습니다. GAN(Generative Adversarial Network)은 두 개의 신경망, 즉 생성기(Generator)와 판별기(Discriminator)로 구성되며, 이들은 끊임없는 숨바꼭질 게임을 벌입니다. 생성기는 가짜 이미지를 만들고, 판별기는 가짜 이미지와 실제 이미지를 구분하려고 합니다. 시간이 지남에 따라 생성기는 판별기를 속이는 데 매우 능숙해져서 결국 생성한 이미지는 실제 이미지와 구별할 수 없게 됩니다.
GAN은 이미지 생성에 혁신을 가져왔지만, 비디오 생성에는 지속적으로 어려움을 겪었습니다. 핵심 문제는 시간적 불안정성이었습니다. GAN은 현실적인 단일 프레임을 생성할 수 있었지만, 다음 프레임이 첫 번째 프레임의 논리적이고 일관된 연속성을 보장하는 데 엄청난 어려움을 겪었습니다. 이로 인해 깜빡임, 형태 변형 아티팩트, 객체 영속성 결여 등의 문제가 자주 발생했습니다.
바로 이 지점에서 **확산 모델(Diffusion Model)**이 등장합니다. 확산 모델은 단 한 번의 단계로 완벽한 비디오를 생성하려고 하는 대신, 열역학에서 영감을 받은 근본적으로 다른, 보다 체계적인 접근 방식을 취합니다.
확산 과정 설명:
정방향 과정 (노이즈 추가): 깨끗하고 선명한 비디오 클립이 있다고 상상해 보세요. 정방향 과정은 이 클립에 아주 미량의 무작위 노이즈를 단계적으로 체계적으로 추가합니다. 최종적으로는 알아볼 수 없는 순수한 정적 영상만 남게 됩니다. 여기까지는 쉬운 부분입니다.
역방향 과정 (노이즈 제거 학습): 바로 이 부분에서 마법이 일어납니다. AI 모델은 간단하지만 심오한 작업을 수행하도록 훈련됩니다. 즉, 주어진 단계에서 노이즈가 추가된 비디오를 보고 정확히 어떤 노이즈가 추가되었는지 예측하는 것입니다. 최종적으로 깨끗한 비디오를 예측하는 것이 아니라, 노이즈만을 예측하는 것입니다.
생성 (마법의 묘미): 모델 훈련이 완료되면, 생성은 역방향 과정이 실제로 작동하는 단계입니다. 순수한 무작위 노이즈로 이루어진 캔버스에서 시작합니다. 이 캔버스를 모델에 입력하고 "텍스트 프롬프트 '스케이트보드를 타는 고양이'를 바탕으로, 이 정적 영상에 어떤 노이즈가 있다고 생각하나요?"라고 묻습니다. 이 모델은 노이즈를 예측하고, 예측된 노이즈의 작은 양을 이미지에서 빼냅니다. 이 과정을 수백 번 반복합니다. 각 단계마다 이미지는 노이즈가 조금씩 줄어들고 프롬프트에 점점 더 잘 맞춰지면서, 마치 사진이 현상되듯 정적인 이미지에서 선명하고 일관성 있는 영상이 나타납니다.
이러한 단계별 노이즈 제거 과정은 GAN의 전면적인 접근 방식보다 영상 생성에 훨씬 더 안정적이고 강력한 성능을 보여주었으며, 현재의 혁신을 뒷받침하는 견고한 토대를 제공했습니다.
2장: 비디오를 위한 재해석된 트랜스포머 혁명 (DiT)
확산 시대 초창기 몇 년 동안 노이즈 제거 모델에 가장 많이 사용된 아키텍처는 U-Net이었습니다. U-Net은 이미지 대 이미지 작업에 탁월한 합성곱 신경망(CNN)의 한 유형입니다. 하지만 2022년 "Scalable Diffusion Models with Transformers"라는 논문에서 획기적인 아이디어가 제시되었습니다. 바로 U-Net을 트랜스포머로 대체하면 어떨까 하는 것이었습니다. 이 아이디어에서 **Diffusion Transformer(DiT)**가 탄생했고, 현재 OpenL5의 L2를 비롯한 많은 최첨단 모델들이 이 아키텍처를 기반으로 개발되고 있습니다[1].
2.1 트랜스포머가 적합한 이유
트랜스포머는 원래 자연어 처리(NLP)를 위해 설계되었습니다. 트랜스포머의 가장 큰 장점은 문장 속 단어들처럼 시퀀스 내 요소들 간의 관계를 이해하는 것입니다. DiT는 이와 동일한 논리를 시각 데이터에 적용합니다.
DiT는 이미지를 단일 개체로 처리하는 대신, 먼저 이미지를 일련의 더 작은 패치, 즉 "토큰"으로 분해합니다. 그런 다음 이러한 패치들을 문장 속 단어처럼 취급합니다. 이를 통해 모델은 각 패치 내부에 있는 내용뿐만 아니라 모든 패치 간의 복잡한 관계까지 학습할 수 있습니다. 비디오의 경우, 이 모델은 비디오 프레임 시퀀스를 시공간 패치의 긴 문장으로 처리하여 공간과 시간에 걸쳐 객체 간의 관계를 학습할 수 있으므로 더욱 강력한 성능을 발휘합니다[2].
2.2 귀납적 편향의 종식
Transformer가 U-Net에 비해 갖는 핵심적인 장점은 "귀납적 편향"이 없다는 것입니다. CNN인 U-Net은 가까운 픽셀들이 멀리 있는 픽셀들보다 서로 더 밀접한 관련이 있다는 가정을 내재하고 있습니다. 이는 유용한 가정이지만, 동시에 한계점이기도 합니다.
Transformer는 이러한 편향이 없습니다. 아무런 가정도 하지 않고 모든 관계를 처음부터 학습합니다. 따라서 확장성과 유연성이 뛰어납니다. 더 많은 데이터를 입력하고 모델 크기를 키워도 성능은 마치 무한히 향상되는 것처럼 보입니다. 이러한 확장성 덕분에 Sora와 같은 DiT 기반 모델들이 성능 면에서 비약적인 발전을 이룰 수 있었습니다.
3장: 압축의 기술 - VAE 이해하기
고해상도 원본 비디오 프레임에 확산 모델을 적용하는 것은 슈퍼컴퓨터로도 불가능한 계산량입니다. 1080p 비디오 몇 초 분량만 해도 엄청난 양의 데이터입니다. 이를 실현 가능하게 하기 위해 모델은 픽셀 공간이 아닌 압축된 잠재 공간에서 작동합니다.
이러한 압축을 담당하는 도구가 **변분 오토인코더(VAE)**입니다.
VAE는 두 부분으로 구성됩니다.
인코더: 이 네트워크는 고해상도 비디오 프레임을 입력받아 훨씬 작고 밀도 높은 표현인 잠재 벡터로 압축합니다. 이 벡터는 프레임의 핵심 정보를 매우 효율적인 형식으로 담아냅니다.
디코더: 이 네트워크는 잠재 벡터를 입력받아 고해상도 프레임으로 복원합니다.
노이즈를 추가하고 빼는 전체 확산 과정은 이 압축된 잠재 공간에서 이루어집니다. DiT 모델은 실제 픽셀을 직접 보지 않고, 잠재 벡터만 인식합니다. 최종적으로 노이즈가 제거된 잠재 벡터가 생성 과정의 맨 마지막 단계에서 VAE 디코더를 통해 최종적으로 처리되어 최종 영상이 생성됩니다.
비디오의 경우, 특수한 시공간 VAE가 사용됩니다. 이 VAE는 공간 정보(이미지 자체)뿐만 아니라 시간 정보(시간에 따른 이미지 변화)까지 압축하도록 설계되어, 압축된 표현이 부드럽고 일관된 움직임을 생성하는 데 최적화됩니다[3].
4장: 무한 확장 - 전문가 혼합 모델(MoE)의 탁월함
연구자들이 더 높은 품질을 추구하면서, 단순히 모델의 크기를 키우는 것(매개변수를 추가하는 것)이 더 나은 결과를 가져온다는 것을 발견했습니다. 하지만 이는 새로운 문제를 야기했습니다. 단일의 거대한 모델은 실행 비용이 엄청나게 높습니다. 모든 입력에 대해 전체 모델을 활성화해야 하기 때문입니다.
효율적인 모델 확장을 위한 영리하고 점점 더 인기를 얻고 있는 기술인 **전문가 혼합(Mixture of Experts, MoE)**을 소개합니다[4].
MoE 아키텍처는 하나의 거대한 모델을 만드는 대신, "전문가"라고 불리는 더 작고 전문화된 하위 모델들의 집합을 만듭니다. 또한, 작은 "게이팅 네트워크" 또는 "라우터"를 학습시킵니다.
MoE 작동 방식:
입력(노이즈가 포함된 잠재 패치)이 들어오면 먼저 게이팅 네트워크로 전송됩니다.
게이팅 네트워크는 여러 전문가 중 어떤 하나 또는 두 개가 이 특정 입력을 처리하는 데 가장 적합한지 결정합니다.
입력은 선택된 전문가에게만 전송됩니다. 나머지 전문가는 모두 비활성화 상태로 유지되어 엄청난 양의 연산을 절약할 수 있습니다.
이를 대기업에 비유해 보겠습니다. 모든 직원이 모든 회의에 참석하는 대신, 관리자(게이팅 네트워크)가 각 작업을 관련 부서(전문가)에게만 지시하는 것과 같습니다. 이를 통해 회사(모델)는 엄청난 수의 직원(매개변수)을 보유하면서도 개별 작업(추론) 비용은 상대적으로 낮게 유지할 수 있습니다.
알리바바의 Wan 2.2나 구글의 Gemini 제품군과 같은 모델은 MoE(Mixture-of-Experts)를 사용하여 대규모 처리를 구현합니다. 예를 들어, Wan 2.2는 전문가 혼합(Mixture-of-Experts) 방식을 사용하여 일부 전문가는 장면의 전체적인 레이아웃 생성에 특화하고, 다른 전문가는 세부적인 부분을 다듬는 데 특화함으로써 품질과 효율성을 모두 향상시킵니다[5].
5장: 아키텍처의 교향곡
이제 모든 것을 종합해 보겠습니다. 최첨단 텍스트-비디오 변환 모델은 단일 개체가 아니라 이러한 구성 요소들이 조화롭게 작동하는 교향곡과 같습니다.
일반적인 생성 흐름:
프롬프트 인코딩: 입력된 텍스트 프롬프트는 대규모 언어 모델(예: L3 또는 T5)에 입력되어 비디오 모델이 이해할 수 있는 풍부한 수치 표현으로 변환됩니다.
잠재 공간 준비: 시스템은 잠재 공간에 무작위 노이즈 텐서를 생성합니다. 이것이 빈 캔버스입니다.
노이즈 제거 루프(생성의 핵심):
a. 현재의 노이즈가 포함된 잠재 공간과 인코딩된 텍스트 프롬프트는 **확산 변환기(DiT)**에 입력됩니다.
b. MoE 모델인 경우, 게이팅 네트워크는 데이터의 일부를 DiT 내의 특정 전문가에게 전달합니다.
c. DiT는 잠재 공간에 존재하는 노이즈를 예측합니다.
d. 예측된 노이즈는 잠재 공간에서 제거되어 약간 더 깨끗해집니다.
e. 이 루프는 정해진 횟수(예: 50~200회) 동안 반복됩니다.
최종 디코딩: 최종적으로 정제된 잠재 벡터는 공간-시간 VAE의 디코더를 통과합니다.
출력: VAE의 디코더는 잠재 벡터를 재구성하여 최종적으로 화면에 표시되는 고해상도 비디오 프레임을 생성합니다.
이처럼 정교하고 다단계로 구성된 파이프라인 덕분에 이 모델들은 놀라운 성능을 발휘할 수 있습니다. VAE는 효율성을, 확산 과정은 안정성을, 그리고 트랜스포머 아키텍처는 확장성과 강력한 성능을 제공합니다.
아키텍처 차이점과 그 영향
Sora, Kling, Veo와 같은 모델의 고유한 특성은 이러한 구성 요소를 구현하고 우선순위를 정하는 방식에서 비롯됩니다.
Sora의 세계 시뮬레이션에서의 강점은 매우 크고 잘 훈련된 확산 트랜스포머 덕분일 가능성이 높으며, 이를 통해 복잡한 시공간 관계를 학습할 수 있습니다.
WAN 2.2의 영화 같은 화질과 효율성은 오픈 소스 분야에서 최초로 전문가 혼합(Mixture-of-Experts) 아키텍처를 사용한 결과입니다.
L4의 뛰어난 시각적 완성도는 특히 높은 충실도의 VAE와 미적으로 만족스러운 영화 데이터에 대한 광범위한 미세 조정에서 비롯된 것일 수 있습니다.
결론: 마법에서 방법으로
한때 마법처럼 여겨졌던 것이 이제는 바라건대 방법이 되었습니다. L5 비디오 생성은 알 수 없는 예술이 아니라, 영리하고 강력한 아이디어들을 기반으로 구축된 놀라운 엔지니어링의 산물입니다. 확산 프로세스, 트랜스포머, VAE, 그리고 전문가 혼합의 역할을 이해함으로써, 여러분은 더 이상 이러한 도구의 사용자가 아니라, 정보에 입각한 창작자가 될 수 있습니다.
이제 여러분은 마케팅에 현혹되지 않고 모델의 강점과 약점을 결정짓는 근본적인 아키텍처적 선택을 이해할 수 있게 되었습니다. 어떤 모델은 물리 시뮬레이션에 탁월한 반면, 어떤 모델은 조명 시뮬레이션에 탁월하고, 어떤 모델은 오픈 소스인 반면 다른 모델은 클라우드에 종속되는 이유를 더 잘 이해할 수 있습니다.
이러한 지식은 곧 힘입니다. 올바른 도구를 선택하고, 그 기능을 최대한 활용하며, 이 놀라운 분야에서 다음 도약을 예측할 수 있는 힘입니다. 다음에 프롬프트를 입력하고 화면에 펼쳐지는 세상을 볼 때, 마법 같은 결과뿐만 아니라 그 뒤에 숨겨진 놀라운 시스템을 보게 될 것입니다.
그리고 DiT 기반의 Sora부터 MoE 기반의 WAN에 이르기까지, 이 모든 놀라운 시스템의 강력한 기능을 하나의 통합 인터페이스를 통해 활용하고 싶다면, 다음 단계는 분명합니다.