쇼츠 자막 자동으로 넣는 법

쇼츠 영상을 올릴 때마다 자막을 손으로 한 줄씩 입력하고 있다면, 그 시간이 편집 전체의 40~60%를 잡아먹고 있다는 걸 알고 있을 것이다. 쇼츠 자막 자동으로 넣는 법을 모르면 영상 한 편에 30분 이상 소비하는 구조에서 벗어날 수가 없다.

실제로 이 블로그에서 운영 중인 쇼츠 채널은 영상 20여 편을 누적 조회 약 2만 3천 회까지 끌어올렸는데, 그 전 과정에서 촬영과 편집을 0초도 쓰지 않았다. 대본만 쓰면 파이썬 스크립트가 렌더하고, 자막은 그 안에서 자동으로 처리된다. 영상 한 편 제작비는 약 250원이다. 이 구조가 어떻게 돌아가는지, 그리고 지금 당장 적용할 수 있는 방법을 순서대로 정리한다.

왜 수동 자막이 쇼츠 제작의 병목인가

유튜브 쇼츠는 평균 시청 시간이 15초에서 60초 사이다. 시청자가 소리 없이 보는 비율은 플랫폼 공식 통계 기준 약 85%에 달한다. 자막 없는 쇼츠는 시청자의 85%에게 무음 슬라이드쇼와 같다. 즉, 자막은 선택이 아니라 도달률과 직결된 필수 요소다.

그런데 60초짜리 영상에 수동으로 자막을 넣으면 최소 15~30분이 걸린다. 자막 타이밍을 1초 단위로 맞추고, 오타를 수정하고, 폰트와 위치를 정렬하는 과정이 반복된다. 영상을 주 3편 올린다면 자막 작업에만 매주 최소 45분에서 90분을 쓰는 셈이다. 한 달로 환산하면 3시간에서 6시간, 이걸 콘텐츠 기획이나 원고 작성에 쓰면 훨씬 더 많은 영상을 찍어낼 수 있다.

문제는 이 시간을 줄일 방법이 있음에도 대부분의 쇼츠 제작자들이 여전히 수동으로 자막을 입력하고 있다는 점이다. 도구가 없어서가 아니라, 어떤 도구를 어떻게 연결해야 하는지를 모르기 때문이다.

쇼츠 자막 자동으로 넣는 법 — 도구 3가지 비교

자막 자동화를 실현하는 경로는 크게 세 가지다. 각각의 작동 방식과 실제 비용, 한계를 숫자 기준으로 정리한다.

① 유튜브 스튜디오 자동 자막 (무료)

  • 업로드 후 유튜브가 자동 음성 인식(ASR)으로 자막 파일을 생성한다.
  • 처리 시간: 업로드 후 평균 5~15분 소요.
  • 정확도: 조용한 환경, 표준 발음 기준 약 85~90% 수준. 배경 잡음이 있거나 빠른 속도로 말하면 정확도가 60%대로 떨어진다.
  • 한계: 영상이 올라가야 자막이 생성된다. 올리기 전 편집 단계에서 자막을 씌우는 방식이 아니다. 자막 스타일(폰트, 색상, 위치)을 직접 조정할 수 없다.
  • 비용: 0원. 단, 검수에 3~10분 추가 필요.

② CapCut 자동 자막 (무료/유료 혼합)

  • 영상 편집기 안에서 ‘자동 캡션’ 기능을 실행하면 오디오를 분석해 자막을 생성한다.
  • 처리 시간: 60초 영상 기준 약 20~40초.
  • 정확도: 한국어 기준 약 88~92%. 영어보다 한국어 인식이 다소 떨어진다는 사용자 보고가 많다.
  • 강점: 자막 폰트, 색상, 크기, 위치를 편집 단계에서 바로 수정할 수 있다. 쇼츠에 최적화된 세로형 레이아웃 지원.
  • 무료 플랜에서는 워터마크 없이 자막 자동화가 가능하나, 고급 효과는 Pro 플랜 필요(월 약 9,900원).

③ 파이썬 + Whisper API 기반 자동화 (완전 자동)

  • OpenAI Whisper 모델을 API로 연결하면 오디오 파일을 SRT 자막 파일로 변환한다.
  • 정확도: 한국어 기준 약 93~97%. 현재 공개 ASR 도구 중 가장 높은 수준.
  • 처리 비용: Whisper API 기준 1분 오디오당 약 0.006달러(한화 약 8원). 60초 쇼츠 100편을 처리해도 자막 비용은 약 800원.
  • 이 블로그에서 실제로 사용 중인 구조다. 대본 텍스트를 TTS로 변환하고, 그 오디오를 Whisper로 다시 SRT로 만들어 영상에 합성한다. 파이썬이 이 흐름을 전부 처리한다.
  • 초기 세팅 시간: 스크립트 구성에 2~3시간. 이후 영상당 추가 작업 시간은 0초.

파이썬으로 자막 자동화 파이프라인 구성하는 법

이 블로그에서 사용하는 구조는 다음 순서로 돌아간다. 코드를 처음 짜는 사람도 따라갈 수 있도록 각 단계를 구체적으로 서술한다.

1단계 — 대본 작성
텍스트 파일로 대본을 저장한다. 파이썬 스크립트가 이 파일을 읽어서 다음 단계로 넘긴다.

2단계 — TTS로 음성 생성
Google Cloud TTS 또는 Clova Voice API를 사용해 대본 텍스트를 MP3 파일로 변환한다. 이 블로그 기준 음성 생성 비용은 영상 한 편당 약 20~50원 수준이다(문자 수에 따라 다름).

3단계 — Whisper로 SRT 자막 생성
생성된 MP3를 Whisper API에 넘기면 타임스탬프가 붙은 SRT 파일이 출력된다. 타임스탬프 정확도는 0.1초 단위까지 맞춰진다. TTS 음성을 그대로 넣기 때문에 배경 잡음이 없고 인식률이 거의 100%에 가깝다.

4단계 — ffmpeg으로 영상 합성
ffmpeg 명령어로 배경 영상, 음성 파일, SRT 자막을 하나의 MP4로 합친다. 자막 폰트, 크기, 위치, 색상은 ffmpeg의 subtitles 필터에서 미리 설정해둔다. 이 값을 한 번 정해두면 이후 모든 영상에 동일하게 적용된다.

5단계 — 자동 업로드
YouTube Data API를 연결하면 렌더된 영상을 자동으로 업로드까지 처리할 수 있다. 제목, 설명, 태그, 공개 시간 예약도 스크립트 안에서 설정한다.

이 파이프라인이 완성되면 대본 파일 하나를 저장하는 것이 영상 제작의 전부다. 렌더부터 업로드까지 파이썬이 처리하고, 사람이 개입할 지점은 없다. 영상 한 편 제작비 약 250원이라는 수치는 이 구조에서 나온 실측값이다.

자막 스타일 설정 — 쇼츠에서 실제로 읽히는 조건

자막이 자동으로 생성됐다고 해서 그냥 올리면 안 된다. 쇼츠는 9:16 세로 화면이고, 시청자의 시선이 머무는 시간은 평균 0.8초 이하다. 자막이 읽히지 않으면 없는 것과 같다.

ffmpeg 기준으로 실제로 적용 중인 자막 설정값은 다음과 같다.

  • 폰트 크기: 22~28pt (1080×1920 기준). 이보다 작으면 모바일 화면에서 읽기 어렵다.
  • 위치: 화면 하단 기준 15~20% 지점. 유튜브 쇼츠 UI의 좋아요·댓글 버튼이 우측 하단을 가리므로 중앙 하단에 배치한다.
  • 배경 박스: 반투명 검정(알파값 0.5 이하)으로 자막 뒤에 배경을 깔면 어떤 배경 영상에서도 가독성이 유지된다.
  • 한 화면에 표시되는 자막 길이: 1줄에 최대 15자 이내. 15자를 초과하면 자동으로 줄바꿈 처리한다.
  • 자막 지속 시간: 최소 0.8초, 최대 3초. 너무 짧으면 읽히지 않고, 너무 길면 다음 문장과 겹친다.

CapCut을 사용할 경우 위 조건을 수동으로 한 번 설정해두고 템플릿으로 저장하면, 이후 자막 생성 시마다 동일한 스타일이 자동 적용된다. 설정 저장 후 재조정 시간은 영상당 0초다.

자동 자막의 현실 — 조회수와 유입의 괴리

자막 자동화를 완성하면 영상 제작 속도는 올라간다. 하지만 그게 곧 수익이나 유입으로 연결된다는 뜻은 아니다. 이 부분을 솔직하게 써두는 이유는 자막 자동화를 도입하기 전에 기대치를 현실에 맞춰야 하기 때문이다.

이 블로그 기준으로 쇼츠 20여 편의 누적 조회 수는 약 2만 3천 회다. 그런데 그 영상들로 사이트에 들어온 사람은 약 한 달간 7명이었다. 소셜 도달 6만에 이메일 구독자는 0명, 6개월 누적 매출은 19,000원이다.

자막 자동화는 제작 비용을 낮추고 업로드 빈도를 높이는 도구다. 조회수가 유입으로 전환되는 비율은 콘텐츠 기획, CTA 설계, 랜딩 페이지 구조에 달려 있다. 자막이 자동으로 들어간다고 전환율이 올라가는 게 아니다. 이 두 가지를 혼동하지 않아야 한다.

그럼에도 자동화의 가치는 명확하다. 영상 한 편에 250원이면 100편을 만들어도 2만 5천 원이다. 수동 제작 구조에서라면 100편은 물리적으로 불가능한 분량이다. 실험 비용을 낮추는 것 자체가 자동화의 핵심 역할이다.

비코더도 쓸 수 있는 자막 자동화 — CapCut 단일 워크플로

파이썬 스크립트를 구성하기 어렵다면 CapCut 단일 도구로도 쇼츠 자막 자동으로 넣는 법을 실행할 수 있다. 다음 순서를 그대로 따라가면 된다.

  • CapCut 앱 또는 웹 버전(capcut.com)에서 새 프로젝트 생성 후 쇼츠 영상 파일을 업로드한다.
  • 편집 화면 상단 메뉴에서 ‘텍스트’ → ‘자동 캡션’을 선택한다.
  • 언어를 ‘한국어’로 설정 후 ‘생성’ 클릭. 60초 영상 기준 처리 시간 약 30초.
  • 생성된 자막 블록을 선택 후 폰트, 색상, 크기, 위치를 조정한다. 이 설정을 ‘프리셋 저장’으로 등록해두면 다음 영상부터는 생성 즉시 동일 스타일이 적용된다.
  • 오타나 인식 오류는 자막 블록을 직접 클릭해 수정한다. 60초 영상 기준 평균 검수 시간은 2~5분이다.
  • 편집 완료 후 MP4로 내보내기. 해상도는 1080×1920, 프레임레이트 30fps로 설정한다.

이 방식은 코딩 없이 실행 가능하고, 무료 플랜에서도 자막 자동화 핵심 기능이 동작한다. 처음 프리셋을 잡는 데 10~15분, 이후 영상당 자막 검수에 2~5분이면 충분하다. 파이썬 파이프라인에 비해 완전 자동은 아니지만, 수동 대비 작업 시간을 80% 이상 줄일 수 있다.

이 블로그에서 실제로 운영 중인 자동화 구조의 전체 흐름이 궁금하다면 fire20note.com/shorts/ 에서 확인할 수 있다.

지금 바로 시작하는 법

쇼츠 자막 자동으로 넣는 법은 도구 선택보다 파이프라인 설계가 핵심이다. CapCut 자동 캡션으로 당장 오늘부터 수동 자막 작업 시간을 80% 줄일 수 있고, 파이썬 + Whisper 구조를 갖추면 영상당 개입 시간을 0으로 만들 수 있다. 제작 비용 250원, 누적 조회 2만 3천 회라는 수치는 이 자동화 구조가 실제로 작동한다는 증거다. 전환율은 자막 자동화 이후의 과제지만, 자막 없이는 그 이후의 과제 자체가 없다. 오늘 영상 하나에 자동 자막을 붙이는 것부터 시작하라.

이 시스템을 직접 설계한 FIRE 계산기와 자동화 가이드를 무료로 받아가세요.
👉 fire20note.com/shorts/ 에서 무료로 받기


이 방식으로 제 채널을 돌리고 있습니다.

대본 공식, 예시 대본 12편, 숫자로 고치는 법, 그리고 대본을 넣으면 여러 편이 한 번에 렌더되는 파이썬 키트까지 정리했습니다. 얼굴도 목소리도 나가지 않습니다.

얼굴 없는 쇼츠 릴스 반자동화 시스템 (29,000원~) 보러가기

댓글 달기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

위로 스크롤