AI는 미래다

시댄스 2.5 정식 출시 — 30초 원패스, 50개 레퍼런스, 4모드 편집 정리

· 2026-08-15 (토) 22:24:55 · 346

바이트댄스가 7월 31일에 시댄스 2.5(Seedance 2.5)를 정식 출시했습니다. 시댄스 2.0 쓰시던 분들은 체감이 확 다를 텐데요, 핵심만 추려서 정리합니다.


바뀐 것 세 줄 요약

클립 길이: 15초 → 30초 (이음새 없이 원패스) 레퍼런스: 12개 → 50개 (이미지 30 + 비디오 10 + 오디오 10) 편집: 기본 → 4모드 (타임스탬프/그린스크린/카메라/참조 편집)

프롬프트 준수율도 약 20% 올라갔습니다. 자세한 정보는 시댄스 2.5에서 확인 가능합니다.


30초 싱글샷이 왜 중요한가

시댄스 2.0에서 15초 넘는 영상 만들려면 클립을 여러 개 생성해서 이어 붙여야 했습니다. 이 과정에서 생기는 문제가 두 가지였는데요.

첫째, 캐릭터 얼굴이 클립마다 미묘하게 달라집니다. 같은 아이덴티티 이미지를 넣어도 이음새에서 드리프트가 발생했습니다.

둘째, 조명이나 분위기의 연속성이 깨집니다. 앞 클립은 차가운 톤인데 뒤 클립은 따뜻한 톤으로 나오는 경우가 있었습니다.

시댄스 2.5는 30초를 하나의 생성으로 처리하기 때문에 이 문제가 원천적으로 없습니다. 오프닝, 미들, 클로징까지 캐릭터·조명·분위기가 일관되게 유지됩니다.

30초가 어느 정도 길이인지 감이 안 오시는 분을 위해 — TV 광고 1편, 유튜브 숏츠 1편, 뮤직비디오 원코러스입니다. 짧은 이야기의 시작과 끝을 담기에 충분한 길이입니다.

연장을 쓰면 더 길게도 가능합니다. 2회 연장하면 약 90초, 짐잉 플랫폼의 베타 울트라롱 모드에서는 180초(3분)까지 보고되었습니다.


50개 레퍼런스의 실제 의미

숫자만 보면 "12개에서 50개로 늘었구나" 정도인데, 실제로 쓰면 차이가 큽니다.

시댄스 2.0에서는 이미지 9장이 한도였습니다. 주인공 얼굴 2~3장, 의상 2~3장, 배경 2~3장 넣으면 슬롯이 끝납니다. 조연을 추가하거나, 소품을 넣거나, 무드보드를 참조시킬 여유가 없었습니다. 멀티캐릭터 장면은 4~5명이 물리적 한계였습니다.

시댄스 2.5에서는 이미지 30장, 비디오 10개, 오디오 10개를 한 번에 넣을 수 있습니다.

실전 활용 예시를 들면 이렇습니다. 주인공 3장(정면/측면/전신) + 조연 2명 각 2장 + 의상 5장(장면별) + 배경 5장(장면별) + 무드보드 3장 + 소품 2장 = 이미지 24장. 카메라 워크 참조 2개 + 전환 효과 1개 = 비디오 3개. BGM 2개 + 환경음 1개 + 음성 톤 1개 = 오디오 4개. 합계 31개. 아직 19개 슬롯이 남아있습니다.

FORCE 컨퍼런스에서 10명 이상의 배우를 동시에 배치하는 데모가 시연된 것도 이 용량 덕분입니다.

핵심 원칙은 하나입니다. 각 파일에 역할을 명확히 지정하세요. "이미지 1~3은 주인공 얼굴, 이미지 4~5는 의상, 비디오 1은 카메라 참조, 오디오 1은 BGM." 역할 없이 넣으면 모델이 혼동합니다. 50개를 다 채우는 것보다 역할이 명확한 20개가 더 좋은 결과를 만듭니다.

오디오는 단독으로 넣을 수 없고, 반드시 이미지나 비디오와 함께 넣어야 합니다.


4모드 편집 — 실무에서 제일 쓸모 있는 변화

개인적으로 이번 업데이트에서 가장 쓸모 있는 부분입니다.

타임스탬프 레벨 제어: 특정 시간 구간만 수정합니다. "12~15초의 조명을 바꿔주세요." 해당 구간만 바뀌고 나머지는 그대로입니다.

그린스크린 교체: 배경을 자동으로 떼서 새 환경으로 바꿉니다. 크로마키 후처리가 필요 없습니다.

카메라 재편집: 카메라 앵글이나 움직임만 사후에 변경합니다. 영상 내용은 유지되고 촬영 방식만 바뀝니다.

레퍼런스 기반 편집: 수정할 클립을 넣고 자연어로 "배경을 해변으로 바꿔. 나머지 유지."라고 지시합니다.

기존에는 결과물이 90% 마음에 들어도, 나머지 10%를 고치려면 전체를 다시 생성해야 했습니다. 다시 생성하면 좋았던 90%마저 달라질 수 있었고요. 이제 해당 부분만 정밀하게 수정할 수 있습니다.

실전 팁: 한 번에 한 가지만 수정하세요. 배경이랑 조명이랑 사운드를 동시에 바꾸면 뭐가 잘됐고 뭐가 안됐는지 판단이 어렵습니다. 순서대로 하나씩 고쳐나가는 방식이 안정적입니다.


오디오 업그레이드

영상과 같은 패스에서 스테레오 오디오가 나옵니다. 대사, 효과음, 환경음이 화면 액션에 맞춰 자동 타이밍됩니다. 10개 이상 언어가 지원되고, 오디오 레퍼런스 슬롯이 3개에서 10개로 늘었습니다.

사운드도 구체적으로 디렉팅해야 합니다. "적절한 배경음"이라고 쓰면 적절한(밋밋한) 결과가 나옵니다. "발걸음 소리, 카페 소음, 에스프레소 머신, 0:15에 문 열리는 소리, 음악 없음"처럼 악기·효과음·타이밍·침묵을 명시하면 레이어드된 사운드가 생성됩니다.


프롬프트 작성

30초 영상은 15초와 달리 시간 흐름이 들어가야 합니다.

오프닝(0~8초)에서 장면 설정과 캐릭터 소개. 미들(8~20초)에서 핵심 액션. 클로징(20~30초)에서 마무리. 각 구간에 카메라와 사운드 변화를 같이 써주면 됩니다.

카메라 용어는 영어가 가장 정확합니다. Low-angle tracking, push-in, orbital, crane, Steadicam, Dutch angle 등.

프롬프트 준수율이 약 20% 올라간 덕에, 30초 영상의 후반부 지시가 무시되는 현상이 줄었습니다. 복잡한 프롬프트도 첫 생성에서 의도대로 나올 확률이 높아졌습니다.


어디서 쓰나

짐잉 AI, 더우바오 프로, Dreamina에서 소비자용으로 이용 가능합니다. BytePlus ModelArk API는 8월 7일 전면 개방 예정이며, 무료 쿼터 없이 잔액 $30 이상이 필요합니다.


해상도 주의

"시댄스 2.5 = 4K"라는 기사가 많은데, 네이티브 4K 출력은 시댄스 2.0의 스펙입니다. 같은 컨퍼런스에서 두 모델이 동시에 소개되면서 혼동이 생긴 겁니다. 바이트댄스 공식 2.5 페이지에서는 출력 해상도를 명시하지 않았습니다. 소셜 미디어 용도로는 현재 출력으로 충분하지만, 4K가 필수라면 확인하고 쓰시는 게 좋겠습니다.


정리

시댄스 2.5 = 길이 ×2 + 레퍼런스 ×4 + 편집 ×4 + 프롬프트 준수 +20%. 시댄스 2.0을 쓰면서 "좀만 더 길었으면", "레퍼런스가 모자라", "이 부분만 고치고 싶다"고 느꼈던 분이라면, 2.5가 정확히 그 세 가지를 해결해줍니다.

|
댓글을 작성하시려면 로그인이 필요합니다.

자유게시판

203,066건
+
제목 글쓴이 날짜 조회
08-15 조회 347
08-15 조회 306
08-15 조회 333
08-15 조회 517
08-15 조회 320
08-15 조회 287
08-15 조회 365
08-14 조회 279
08-14 조회 254
08-14 조회 390
08-14 조회 338
08-14 조회 324
08-14 조회 233
08-14 조회 534
08-14 조회 344
08-14 조회 309
08-14 조회 256
08-14 조회 330
08-14 조회 281
08-14 조회 238