쓸모 쓸모연구소 · 실전 노트
제 284 호이번 주 새 글 158 편2026 · 09 · 30
AI 크리에이티브
GPT-6 아스트라 · ElevenLabs

이 글에는 쿠팡 파트너스 링크가 있으며, 구매 시 일정액의 수수료를 받습니다.

GPT-6 아스트라 영상 자동화, 프롬프트 한 줄로 대본·음성·편집까지

GPT-6 아스트라 영상 자동화가 지금 어디까지 왔는지, 프롬프트 한 줄로 영상 한 편을 통째로 맡긴 사례로 정리했습니다. 사례 조사, 대본, 클론 음성, 캐릭터 화면, 편집이 어떤 순서로 돌아갔는지와 사람이 중간에 한 일, 그리고 직접 따라 해 볼 때 쓸 단계별 프롬프트까지 담았습니다.

GPT-6 아스트라 영상 자동화, 프롬프트 한 줄로 대본·음성·편집까지 삽화
삽화 · 쓸모연구소

GPT-6 아스트라가 만든 영상, 앞은 쇼케이스 뒤는 제작 후기

영상의 내레이션은 사람이 하지 않습니다. "저는 GPT 아스트라입니다"로 시작하죠. 목소리는 채널 주인(스마트대디)의 클론이고, 사례 조사부터 대본·음성·화면·편집까지 전부 아스트라가 했다는 설정입니다. 영상 자체가 결과물이자 증거인 셈입니다.

구성은 두 덩어리입니다. 앞의 약 1분 반은 다른 사람들이 아스트라로 만든 사례 5가지이고, 그 뒤는 지금 보고 있는 영상이 어떻게 만들어졌는지를 아스트라가 1인칭으로 설명합니다.

미리 말해 두면, 이 영상에는 따라 할 수 있는 클릭 경로나 메뉴 이름이 나오지 않습니다. 쇼케이스와 후기니까요. 그래서 앞부분은 "이렇게 했다더라"의 기록이고, 실제로 해 보는 방법은 글 뒤쪽 편집자 정리에서 따로 채웠습니다. 육성으로 읽어 준 프롬프트 한 줄은 그대로 복사해 쓸 수 있습니다.

아스트라로 만든 사례 5가지

미니카 시뮬레이션, 책상 위가 서킷이 된다

카운트다운이 끝나면 책상 위에서 레이싱이 시작됩니다. 화자는 "아스라다" 같다고 반응합니다. 아스라다는 애니메이션 《사이버 포뮬러》에 나오는 차 이름입니다(영상 밖 일반 설명). 가라지 화면에서는 모터, 기어, 롤러까지 부품을 뜯어볼 수 있습니다. 첫 결과를 받은 뒤 계속 다듬어서 이 정도가 됐다고 합니다.

고흐 그림 속 마을, 그림 6점을 하나로

고흐의 침실에서 밖으로 나가면 밤의 카페가 나오고, 더 가면 노란 들판이 펼쳐집니다. 그림 여섯 점을 하나의 마을로 합친 3D 공간입니다. "아스트라 맥스"로 만들었다고 소개합니다.

슈팅 게임, 게시글에는 한 줄뿐

배틀그라운드나 서든어택 느낌이 나는 슈팅 게임입니다. 라일리 브라운(Riley Brown)이 올린 시연인데, 게시글에는 딱 한 줄만 적혀 있었다고 합니다. 그 한 줄의 내용은 자막 오인식으로 판독하지 못했습니다. 무기를 바꾸고 상대를 맞히면 점수가 바로 올라갑니다. 슈팅 게임에서 중요한 건 조작에 반응하는 플레이감인데, 그게 살아 있다는 평가입니다.

광고 속 낚시 게임을 진짜로 만들기

광고에서는 재미있어 보이는데 막상 깔면 그 게임이 아닌 경우, 많이들 겪어 보셨을 겁니다. 이 사례의 제작자는 그 광고 영상만 아스트라에게 주고 "이거 진짜로 만들어"라고 시켰습니다. 왼쪽이 원래 광고, 오른쪽이 아스트라가 만든 게임입니다. 그물이 날아가는 타이밍, 손님이 몰려오는 연출, 접시가 쌓이는 것까지 같습니다.

영상만 보고 웹사이트 복제

마지막은 게임이 아니라 웹 화면입니다. 원본 영상 하나만 주고 웹사이트를 그대로 구현했습니다. 카드가 돌아가는 움직임까지 따라 만들었고, 다른 카드로 바꿔 볼 수도 있습니다. 화면을 보고 만들고, 다시 비교하는 방식입니다.

아스트라 영상 자동화는 이 순서로 돌아갔다

여기부터는 아스트라가 1인칭으로 자기 작업을 설명하는 대목입니다. 영상 순서 그대로 옮깁니다.

1. 자료 조사, 후보 11개에서 시작

X(옛 트위터)에서 사례를 찾고, 제작자 원문과 시연 영상을 직접 열어 확인했습니다. 처음 확인한 사례는 11개였습니다. 원문과 영상이 실제로 있는지 보고, 볼 만한 구간을 골라 사람이 바로 재생해 볼 수 있게 정리했습니다.

그다음 사람의 수정 요청이 들어옵니다. 얼굴이 나오는 사례는 빼 달라고 해서 후보를 다시 골랐고, 음악 사례는 앞에서 본 광고 게임으로 교체했습니다.

  • 작업 원칙: 소스 확인, 대본 확인, 제작. 앞 단계를 통과해야 다음으로 넘어갑니다.

2. 재료와 대본

재료는 새로 만들지 않고 미리 준비해 둔 것을 가져다 썼습니다.

  • 일레븐랩스(ElevenLabs, 목소리를 복제하고 글을 음성으로 바꿔 주는 서비스)의 클론 목소리
  • GPT 캐릭터 이미지
  • 배경 디자인

쓸 파일을 골라 작업에 붙이는 식입니다. 대본은 "결과 먼저, 제작 과정 나중" 구조로 썼습니다. 초안은 설명만 계속돼서 지루하다는 피드백을 받았고, 그래서 짧은 반응과 농담을 넣었습니다. 스마트대디가 직접 문장을 고치기도 했습니다. 대본까지 확인받은 뒤에야 소리와 화면을 붙입니다.

3. 음성, 속도는 1.1

일레븐랩스에 있는 스마트대디 클론 보이스를 썼습니다. 클론 자체는 사람이 미리 직접 녹음해 만들어 둔 것입니다.

  • 클론을 선택하고 장면별 대본을 넣어 음성을 생성
  • 앞선 샘플이 너무 느려서 속도를 1.1로 설정
  • 어색하게 들리는 감탄사나 이름은 문장을 나눠 다시 생성
  • 음성을 장면별로 쪼개 두면 한 문장 고쳤다고 처음부터 다시 만들 필요가 없음

마지막 항목이 이 영상에서 가장 실용적인 이야기라고 봅니다. 긴 대본을 한 파일로 뽑으면 발음 하나 때문에 전체를 다시 생성해야 하지만, 장면 단위로 나눠 두면 해당 조각만 갈아 끼우면 됩니다.

4. 캐릭터와 화면

준비된 GPT 아스트라 캐릭터 이미지에 움직임을 붙였습니다. 어떤 동작을 하면 좋을지도 아스트라가 프롬프트를 짜서 짧은 영상으로 만들었습니다. 이때 쓴 도구는 자막에 "필드"로만 찍혀 있는데, 뒤에서 비용을 말하며 힉스필드(Higgsfield, 이미지·영상 생성 서비스)를 언급하므로 힉스필드로 보입니다.

처음에는 움직임이 너무 작았습니다. 팔을 더 크게 펼치도록 수정하고, 선글라스를 쓴 장면도 추가했습니다. 여기에 목소리를 따로 붙여 편집하니 캐릭터가 진행하는 느낌이 났다고 합니다.

화면 UI는 맥(macOS) 창 모양으로 보이는 스타일로 디자인했습니다. 동작은 이렇습니다.

  • 파일을 고르면 미리보기가 열린다
  • 선택한 영상이 편집 트랙으로 들어간다
  • 결과물은 전체 화면으로 크게, 설명할 때는 다시 창으로 돌아온다

5. 편집과 검수

편집은 하이퍼프레임즈(HyperFrames, HTML로 장면을 짜서 영상으로 렌더링하는 도구)로 했습니다. 영상과 목소리를 놓고, 말하는 순간에 자막과 움직임을 맞췄습니다. "여기는 크게, 여기 전환은 빠르게" 식으로 사람이 말하면 아스트라가 프로젝트를 고쳐 다시 렌더링합니다(렌더링은 편집 결과를 실제 영상 파일로 뽑아내는 작업).

출력본은 자막과 소리가 맞는지 확인하고 고쳤습니다. 사람이 사례와 대본을 확인하고 피드백을 주면 반영해서 다시 뽑는 루프입니다.

시간과 비용

  • 첫 출력까지 약 1시간이 걸렸습니다.
  • 화면에는 완성본의 제작·검수 기록이 뜨고, 사용한 토큰을 아스트라 API 단가로 환산한 금액도 나옵니다. 다만 그 숫자는 화면에만 있어 이 글에서는 판독하지 못했습니다.
  • 일레븐랩스와 힉스필드 비용은 별도입니다.
  • 목소리 클론과 캐릭터 이미지는 미리 준비해 뒀습니다. 그 준비 비용이 위 금액에 포함되는지는 영상에서 말하지 않습니다.

요금제별 가격과 사용량 한도는 자주 바뀌므로, 실제로 해 보기 전에 ChatGPT·일레븐랩스·힉스필드 각각의 공식 요금 안내를 확인해야 합니다.

사람이 준 프롬프트는 이 한 줄

화자가 육성으로 읽어 준 프롬프트 전문입니다.

프롬프트
아스트라 활용 사례를 조사하고 분석해서 핵심을 정리한 영상과 제작법까지 소개하는 영상을 처음부터 끝까지 만들어 줘.

읽고 나서 이렇게 덧붙입니다. "사례와 대본은 제가 확인하고 결과를 보면서 고쳐갔습니다." 프롬프트 한 줄에 중간 확인과 피드백, 그게 사람이 한 일의 전부라는 주장입니다.

화자가 실제로 권한 작업 원칙 4가지

영상 전체에서 "이렇게 하라"에 가까운 말은 네 가지입니다.

  • 소스 확인, 대본 확인, 제작 순서를 지킨다. 앞 단계를 통과시키고 다음으로 넘어간다.
  • 음성은 장면별로 나눠 생성한다. 한 문장 수정 때문에 전체를 다시 뽑지 않으려고.
  • 생성 음성이 느리면 속도를 올린다(이 영상에서는 1.1).
  • AI가 쓴 대본이 지루하면 짧은 반응과 농담을 넣고, 사람이 문장을 직접 손본다.

영상에 없는 배경 (편집자 정리)

여기부터는 영상에서 다루지 않은 내용입니다. 실제로 따라 해보려면 알아야 하는 것들을 따로 정리했습니다.

준비물

  1. 아스트라를 쓸 수 있는 ChatGPT 요금제와 데스크톱 앱. 파일을 만들고 고치는 작업이라 내 컴퓨터 폴더에 접근할 수 있는 작업 모드(워크 모드나 코덱스)에서 진행하는 편이 맞습니다.
  2. 작업 폴더 하나. 그 안에 assets(캐릭터 이미지, 배경), voice(음성 조각), output(완성본) 하위 폴더를 미리 만들어 둡니다.
  3. 일레븐랩스 계정과 내 목소리 클론. 목소리 메뉴(Voices)에서 새 목소리 추가를 누르고 복제(Voice Clone) 방식을 고른 뒤, 조용한 곳에서 녹음한 내 목소리 파일을 올리면 됩니다.
  4. 캐릭터 이미지 1장과 배경 디자인. 영상처럼 미리 만들어 두면 매번 새로 생성하는 비용이 줄어듭니다.
  5. 캐릭터에 움직임을 붙일 영상 생성 도구(영상에서는 힉스필드로 보입니다)와 편집 도구.

한 줄 대신 단계별로 시키는 프롬프트

영상은 한 줄로 시작했지만, 실제로는 사람이 세 번 확인하고 넘어갔습니다. 처음 해 본다면 그 확인 지점을 프롬프트에 박아 두는 편이 안전합니다. 아래는 편집자가 영상의 작업 순서를 그대로 옮겨 만든 예시입니다.

프롬프트
[1단계: 소스만]
주제는 "{주제}"야. X와 유튜브에서 실제 사례를 찾아서 원문 링크와 시연 영상이 실제로 있는 것만 8~10개 골라 줘.
사람 얼굴이 나오는 사례는 빼 줘. 각 사례마다 볼 만한 구간과 한 줄 요약을 표로 정리하고, 아직 대본은 쓰지 마.
프롬프트
[2단계: 대본만]
확인한 사례 중 1, 3, 4, 6, 7번으로 3분 안팎 영상 대본을 써 줘.
결과를 먼저 보여 주고 제작 과정은 뒤에 두는 구조로, 장면마다 번호를 붙이고 한 장면은 두세 문장으로.
설명만 이어지지 않게 짧은 반응과 가벼운 농담을 섞어 줘. 음성과 화면 작업은 아직 하지 마.
프롬프트
[3단계: 제작]
확정된 대본으로 제작을 시작해. 음성은 장면 번호별로 따로 생성해서 voice 폴더에 저장하고 속도는 1.1로 맞춰 줘.
캐릭터는 assets 폴더의 이미지를 쓰고, 각 장면에 맞는 짧은 동작 영상을 만들어 줘.
편집은 말하는 순간에 자막과 화면 움직임을 맞추고, 완성본은 output 폴더에 저장한 뒤 자막과 소리가 맞는지 점검해 줘.

수정은 짧게 말로 하면 됩니다. "4번 장면은 화면을 크게", "캐릭터 팔 동작을 더 크게", "6번 음성만 다시" 같은 식입니다. 음성을 장면별로 나눠 뒀기 때문에 한 장면만 다시 뽑아도 전체가 흔들리지 않습니다.

막히는 지점

  • 남의 영상·게시물 사용: 사례 소개 영상은 다른 사람의 시연 화면을 가져다 쓰는 구조입니다. 출처를 표시하고, 필요한 구간만 짧게 쓰는 편이 안전합니다.
  • 목소리 클론 동의: 클론은 본인 목소리로만 만드는 것이 원칙입니다. 다른 사람 목소리를 복제하려면 당사자 동의가 필요합니다.
  • 토큰 비용: 조사, 대본, 편집 수정이 모두 아스트라 사용량을 씁니다. 수정 요청을 한 번에 몰아서 주면 왕복 횟수가 줄어듭니다.
  • 렌더링 오류: 편집 도구가 설치돼 있지 않으면 아스트라가 설치부터 하려고 할 수 있습니다. 권한 요청이 뜨면 무엇을 설치하는지 읽고 승인합니다.

판단 기준

이 방식이 맞는 경우는 같은 형식의 영상을 반복해서 만드는 채널입니다. 캐릭터, 목소리, 배경을 한 번 준비해 두면 이후에는 주제만 바꿔 같은 루프를 돌릴 수 있습니다. 반대로 한 편만 만들 거라면 준비물(클론, 캐릭터, 편집 도구)을 갖추는 시간이 더 걸릴 수 있습니다.

쇼케이스로 보면 맞는 영상

인상적인 건 결과물보다 루프 쪽입니다. 사람은 프롬프트를 던지고, 중간중간 "이건 빼", "여기는 크게"라고 말하고, 나머지를 AI가 다시 돌립니다. 화자도 "이번엔 저도 하면서 좀 무서웠는데요"라고 합니다.

다만 이 영상만 보고 같은 걸 만들 수는 없습니다. 도구 이름 몇 개가 지나갈 뿐 어느 메뉴를 누르는지, 어떤 플랜이 필요한지는 나오지 않습니다. 비용도 화면 숫자를 읽어야 알 수 있고요.

그래서 이 영상은 따라 하기용 강의가 아니라, 지금 아스트라로 어디까지 가능한지 보여 주는 쇼케이스로 보는 편이 맞습니다. 가져갈 건 프롬프트 한 줄과 작업 순서 원칙, 그리고 장면별 음성 분할 같은 잔기술입니다.

자주 묻는 질문

GPT-6 아스트라로 영상을 처음부터 끝까지 만들 수 있나요?

이 영상에서는 가능했다고 주장합니다. 사례 조사, 대본, 음성, 화면, 편집을 아스트라가 맡았고 첫 출력까지 약 1시간이 걸렸습니다. 다만 목소리 클론과 캐릭터 이미지는 사람이 미리 준비했고, 소스와 대본 확인도 사람이 했습니다.

아스트라 영상 제작에 들어간 비용은 얼마인가요?

정확한 금액은 알 수 없습니다. 토큰을 API 단가로 환산한 금액이 화면에만 나와 판독하지 못했고, 일레븐랩스와 힉스필드 비용은 별도라고만 말합니다. 실제로 해 보기 전에 각 서비스의 공식 요금 안내를 확인해야 합니다.

AI 음성을 장면별로 나눠 만드는 이유는 무엇인가요?

수정 비용을 줄이기 위해서입니다. 대본 한 문장을 고쳤을 때 전체 음성을 다시 뽑지 않고 해당 장면만 다시 생성하면 됩니다. 어색한 감탄사나 이름도 문장을 나눠 다시 만드는 방식으로 고쳤습니다.

프롬프트 한 줄만 주면 되나요?

시작은 한 줄이었지만 중간 확인은 사람이 했습니다. 소스 확인, 대본 확인, 제작 순서로 넘어갔고, 얼굴 나오는 사례 빼기나 대본 톤 수정 같은 피드백이 여러 번 들어갔습니다. 처음이라면 위 편집자 정리처럼 단계를 나눠 시키는 편이 결과를 통제하기 쉽습니다.

이 글은 자동 자막 기반(빠른 모드)으로 정리했고, 화면에 뜬 내용은 대조하지 못해 화면에만 표시된 숫자는 판독 불가로 남겼습니다. 자막에는 ChatGPT 아스트라가 "채치피티 아스트랙", 고흐가 "고후", 힉스필드가 "익스필드"와 "필드", 하이퍼프레임즈가 "하이퍼프레임", 맥 스타일 UI가 "맥스 스타일"로 찍혀 있습니다. 편집자 정리의 준비물과 단계별 프롬프트는 영상 속 작업 순서를 바탕으로 편집자가 구성한 것입니다.

출처: youtu.be/… (스마트대디_SmartDaddy, 273초)

원본 영상 보러가기 ↗