알리바바 Wan 3.0이 보여준 AI 영상의 다음 단계는 ‘화질’보다 ‘생산성’이다

단일 영상 최대 30초·문서 입력 지원…캐릭터·소품·공간·스타일 일관성 강화

공개 테스트부터 숏폼·광고·MV 등에 활용…정식 출시와 함께 API 제공

9월 23일까지 표준판 30% 할인…480P·720P·1080P 초당 0.21·0.42·0.84위안

2026년 8월 24일 알리바바의 영상 생성 모델 Wan 3.0이 정식 서비스를 시작했다. 지난 8월 6일 공개 테스트에 들어간 지 약 3주 만이다. 중국 언론의 보도에 따르면 Wan 3.0은 영상 생성 시간과 입력 방식, 인물 표현과 장면 간 일관성 등을 강화했다. 한 번에 최대 30초 분량의 영상을 생성할 수 있고, 기존 텍스트·이미지·오디오·비디오 입력에 더해 문서와 웹 링크도 활용할 수 있다.

 

이번 버전에서 주목할 부분은 단순히 영상을 더 길게 생성하는 데 있지 않다. 여러 장면을 연결하고 다양한 자료를 영상 제작 과정에 활용할 수 있도록 기능을 확장했다는 점이다. AI 영상 생성 시장의 관심도 조금씩 달라지고 있다. 한 번 생성했을 때 얼마나 인상적인 결과가 나오는지를 넘어, 같은 작업을 반복했을 때 얼마나 안정적으로 원하는 결과를 얻을 수 있는지가 중요해지고 있다. Wan 3.0이 강조하는 지점도 여기에 가깝다.

 

알리바바의 영상 생성 AI 모델 ‘Wan 3.0’이 2026년 8월 24일 정식 출시됐다. 최대 30초 영상 생성과 문서 입력 등을 지원한다. 이미지=AI생성

 

Wan 3.0은 한 번에 최대 30초 분량의 영상을 생성할 수 있다. 연속적인 카메라 움직임과 한 장면에서 이야기를 이어가는 연속 촬영을 지원한다. 생성한 영상은 연장 기능을 활용해 스토리를 추가로 이어갈 수도 있다. 영상 생성 모델에서 길이는 단순한 숫자가 아니다. 생성 시간이 길어질수록 캐릭터와 소품, 배경, 카메라 시점과 공간 관계를 지속적으로 유지해야 하기 때문이다. 중국 언론의 보도에 따르면 Wan 3.0은 추격 장면처럼 인물이 차량에 올라타고 이동한 뒤 고속 주행과 폭발로 이어지는 장면에서 인물과 차량, 주변 환경의 일관성을 유지하는 데 초점을 맞췄다.

 

여기서 중요한 것은 특정 데모 영상이 얼마나 인상적인가가 아니다. 실제 제작에서는 한 번 잘 나온 영상보다 필요한 장면을 여러 차례 생성해도 일정한 수준의 결과를 얻을 수 있는가가 더 중요하다. 광고 영상이나 숏폼 드라마처럼 여러 컷을 연결해야 하는 작업에서는 특히 그렇다. 캐릭터의 얼굴이나 의상이 장면마다 바뀌거나 차량의 형태가 달라지면 제작자는 다시 생성하고 수정하는 작업을 반복해야 한다.

 

이 과정이 길어지면 AI를 활용해 절약하려던 제작 시간이 오히려 늘어날 수 있다. 따라서 Wan 3.0이 내세우는 일관성 강화는 단순한 화질 경쟁과는 다른 문제다. AI 영상을 실제 제작 공정에 넣을 수 있느냐는 질문과 연결된다. 이번 버전에서 산업적 활용 가능성을 보여주는 또 하나의 변화는 문서 입력이다. 중국 언론의 보도에 따르면 Wan 3.0은 기존 텍스트·이미지·오디오·비디오 입력에 더해 DOC, XLS, PPT, PDF, MD, TXT, KEY, PAGES, NUMBERS 등의 문서와 웹 링크를 지원한다. 파일이나 링크는 최대 100MB, 문서는 최대 50페이지까지 입력할 수 있다.

 

이 기능의 의미는 단순한 ‘파일 업로드 지원’에 그치지 않는다. 기업의 영상 제작 과정에는 이미 영상이 아닌 자료가 상당 부분 존재한다. 상품 설명서, 교육자료, 사업보고서, 프레젠테이션, 데이터 표, 업무 문서 등이 대표적이다. 기존에는 이런 자료를 사람이 읽고 영상용 대본이나 스토리보드로 다시 정리해야 했다.

 

중국 언론의 보도에 따르면 Wan 3.0은 문서의 계층과 레이아웃, 표와 데이터 관계 등 구조화된 정보를 이해해 영상 제작에 활용하는 방향을 제시한다. 예를 들어 기업의 PPT를 제품 소개 영상으로 바꾸거나 교육자료를 숏폼 콘텐츠로 재구성하는 작업을 생각할 수 있다. 물론 문서가 영상으로 변환된다는 사실만으로 전문적인 영상 제작 과정 전체가 사라지는 것은 아니다. 결과물의 정확성과 편집 완성도는 별도의 검토가 필요하다.

그럼에도 기업 내부에 이미 존재하는 문서를 영상 콘텐츠의 출발점으로 활용할 수 있다는 점은 생성형 AI의 활용 영역을 넓히는 변화다. Wan 3.0은 인물 생성과 참조 영상 생성에서도 일관성을 주요 기능으로 내세운다.

 

중국 언론의 보도에 따르면 이 모델은 인물의 얼굴과 피부 질감, 표정, 신체 움직임 등을 표현하고, 참조 소재를 활용하는 작업에서는 인물·소품·음향·공간 관계·스타일 등 여러 요소를 장면 간에 유지하는 데 초점을 맞췄다. 공개 테스트 과정에서 기업 사용자들이 반복적으로 언급한 평가 역시 ‘안정성’, ‘실재감’, ‘질감’이었다고 중국 언론은 전했다.

 

여기서 ‘실재감’이라는 표현은 주의해서 볼 필요가 있다. AI 영상에서 현실감은 단순히 피부를 얼마나 정교하게 표현하느냐의 문제가 아니다. 얼굴과 몸의 움직임이 자연스럽게 이어지고, 조명과 재질이 장면 안에서 일관되게 보이며, 표정 변화가 움직임과 연결돼야 한다. 결국 실재감 역시 장기적으로는 생산성의 문제다. 한 장면에서 사람처럼 보이는 것보다 여러 장면에서 같은 인물이 자연스럽게 행동하는 것이 제작 현장에서는 더 중요할 수 있다. Wan 3.0은 스타일 참조 이미지를 활용해 특정한 시각적 분위기를 유지하는 기능도 강화했다.

 

중국 언론의 보도에 따르면 공개된 사례에서는 강한 붉은 색감과 스팀펑크 스타일을 결합한 영상이 소개됐다. 의상의 무게감, 금속 기어의 질감, 촛불의 빛처럼 서로 다른 재질을 하나의 화면 안에서 표현하면서 전체적인 색감과 분위기를 유지하는 방식이다. 이 역시 AI 영상의 방향을 보여주는 사례다. 초기의 생성형 이미지·영상 도구가 특정 스타일을 입히는 데 집중했다면, 제작 현장에서 필요한 것은 스타일을 적용하는 것보다 스타일을 유지하면서 장면과 소재를 통제하는 능력에 가깝다.

 

광고나 브랜드 영상에서는 영상 전체의 색감과 공간, 제품 표현이 일정해야 한다. 따라서 단순한 이미지 생성 능력보다 참조 정보를 얼마나 안정적으로 활용하는지가 중요해진다. Wan 3.0은 공식 출시 전 공개 테스트 기간부터 숏폼 드라마와 영상·광고 제작, 뮤직비디오, 관광·문화 홍보 등의 제작 과정에 활용됐다고 중국 언론은 보도했다.

 

여기서 주목할 것은 특정 작품의 성과보다 AI 영상이 실제 업무 흐름에 어느 정도 들어가고 있는가다. AI 영상 기술은 그동안 데모와 바이럴 영상 중심으로 평가되는 경우가 많았다. 짧은 시간에 사람이 만들기 어려운 영상을 생성하는 능력이 기술력을 보여주는 지표였다. 그러나 상업 제작의 기준은 다르다. 기획된 장면을 반복해서 만들어야 하고, 브랜드의 시각적 기준을 맞춰야 하며, 수정 요청에도 대응해야 한다. 영상 한 편을 만들기 위해 수십 개의 장면을 생성한다면 각각의 결과를 사람이 다시 검수하고 편집해야 한다.

 

따라서 앞으로의 경쟁은 ‘가장 놀라운 한 장면’을 만드는 모델보다 작업자가 원하는 결과를 얼마나 반복적으로 만들어낼 수 있는가에 더 가까워질 가능성이 있다. Wan 3.0이 강조하는 안정성과 일관성은 이 지점에서 산업적 의미를 갖는다. 가격 구조도 이번 출시에서 확인할 부분이다. 중국 언론의 보도에 따르면 Wan 3.0은 알리바바 클라우드 바이롄과 첸원 AI 플랫폼, 완샹 공식 홈페이지, 첸원 앱 등을 통해 이용할 수 있다. API도 제공된다. 또한 8월 24일부터 9월 23일까지 Wan 3.0 표준판 API에 한시적으로 30% 할인 혜택이 적용된다. 할인 후 가격은 480P가 초당 0.21위안, 720P가 0.42위안, 1080P가 0.84위안이다.

 

영상 생성 AI에서 가격은 단순한 소비자 요금 문제가 아니다. 기업이 기존 제작 과정에 AI를 얼마나 깊게 넣을 수 있는지를 결정하는 비용 변수다. 특히 API가 제공되면 영상 생성 기능을 별도의 서비스로 사용하는 것을 넘어 콘텐츠 관리 시스템이나 제작 플랫폼, 사내 업무 시스템과 연결할 가능성이 생긴다.

 

다만 API 가격만으로 실제 제작비를 판단해서는 안 된다. 생성 실패에 따른 재생성 비용, 사람의 검수와 편집, 스토리보드 작성, 음향과 후반작업 등 전체 제작 과정의 비용을 함께 계산해야 한다. Wan 3.0을 두고 AI 영상의 경쟁 기준이 완전히 바뀌었다고 단정하기는 아직 이르다. 중국 언론의 보도에서도 음향의 자연스러움과 텍스트 정확성, 복잡한 다중 객체의 물리적 상호작용 등은 추가 개선이 필요한 영역으로 언급됐다.

 

그러나 이번 출시가 보여주는 방향은 비교적 분명하다. 영상 생성 AI의 경쟁 기준이 단순한 해상도나 한 장면의 시각적 충격에서 벗어나 영상 길이, 장면 간 일관성, 참조 소재 활용, 다양한 입력 형식, 편집 가능성, API 연동과 비용으로 넓어지고 있다는 점이다. 이는 AI 영상이 콘텐츠 제작자의 ‘아이디어를 시각화하는 도구’에서 기업의 제작 과정에 연결되는 소프트웨어로 발전하는 흐름과 맞닿아 있다.

 

앞으로 기업이 AI 영상 모델을 평가할 때도 질문은 달라질 필요가 있다. ‘가장 멋진 영상을 만들어주는가’보다 ‘우리 회사가 매일 필요한 영상을 안정적으로 만들 수 있는가’가 더 중요한 질문이 될 수 있다.

 

Wan 3.0의 경쟁력 역시 여기에 있을 가능성이 있다. 최고의 한 번을 만들어내는 능력보다 일정한 품질의 결과를 반복해서 만들어내는 능력이다. AI 영상의 다음 경쟁은 결국 ‘한 방’의 경쟁에서 ‘생산 시스템’의 경쟁으로 이동할 것인가에 달려 있다.

 

Wan 3.0은 현재 이 질문에 하나의 답을 내놓은 사례다.

 

윤교원 대표 / The K Media & Commerce, kyoweon@naver.com

 

[이 기사의 저작권은 이비즈타임즈에 있습니다]

작성 2026.08.28 11:39 수정 2026.09.02 10:07

RSS피드 기사제공처 : 이비즈타임즈 / 등록기자: 윤교원 무단 전재 및 재배포금지

해당기사의 문의는 기사제공처에게 문의

댓글 0개 (/ 페이지)
댓글등록- 개인정보를 유출하는 글의 게시를 삼가주세요.
등록된 댓글이 없습니다.