Sora 썸네일형 리스트형 SORA 톺아보기 서론- 다양한 지속 시간, 해상도 및 종횡비의 비디오와 이미지에 대해 텍스트 조건부 확산 모델을 훈련합니다.- 우리는 비디오 및 이미지 잠재 코드의 시공간 패치에서 작동하는 트랜스포머 아키텍처를 활용합니다. 가장 큰 모델인 Sora는 1분 분량의 고화질 비디오를 생성할 수 있습니다.- 우리의 결과는 비디오 생성 모델을 확장하는 것이 물리적 세계의 범용 시뮬레이터를 구축하기 위한 유망한 경로임을 시사 이 기술 보고서는 (1) 모든 유형의 시각적 데이터를 생성 모델의 대규모 학습을 가능하게 하는 통합 표현(unified representation)으로 전환하는 방법과 (2) Sora의 기능 및 한계에 대한 정성적 평가에 중점을 둡니다. 모델 및 구현 세부 정보는 이 보고서에 포함되지 않습니다. 많은.. 더보기 이전 1 다음