Animações Cartoon com IA · Personagens, Voz e Continuidade
Dan Kieft transforma fotografias em folhas de personagem, constrói frames de episódio no OpenArt e anima cenas com diálogo no Seedance. Este guia reorganiza a demonstração num sistema de produção repetível, explica os dois métodos de consistência vocal, compara start/end frames com referências de vídeo e inclui um pacote de prompts original para criar uma estética cartoon própria.
Video credit: Dan Kieft. Source video: How To Make AI Cartoon Animation Videos of Yourself.
Quick Summary
- Crédito: o vídeo incorporado, as personagens Dan e Vinny, as imagens demonstradas e o website Cartoon Prompts pertencem a Dan Kieft. Este artigo parte da transcrição fornecida, verifica as ferramentas nas fontes oficiais e acrescenta análise editorial.
- O método tem cinco etapas: escolher uma linguagem visual, criar folhas de personagem, gerar o frame da localização, fixar as vozes e animar cada shot.
- O Cartoon Prompts apresenta atualmente 35 linguagens visuais, 70 folhas de personagem e 35 frames de episódio. O site disponibiliza um template 4K de três painéis e prompts preparados para GPT Image 2 no OpenArt.
- Cada folha usa dois inputs principais: a referência da personagem e o template vazio. O prompt deve dizer que a primeira controla identidade e roupa, enquanto a segunda controla apenas o layout.
- Para a primeira cena, Dan combina duas folhas de personagem e escreve um prompt com deliverable, mapa de referências, cena, câmara, estilo, locks e uma lista curta do que evitar.
- A animação demonstrada usa um frame inicial, uma timeline de 13 segundos, diálogo exato, 1080p e instruções para não fazer zoom, cortes, sobreposição de falas ou paráfrases.
- Uma descrição textual da voz produz variações semelhantes, mas não idênticas. Uma referência de áudio autorizada por personagem dá uma âncora mais forte e deve ser reutilizada em todas as gerações.
- Para continuidade, o método mais previsível é extrair o último frame do shot anterior e usá-lo como primeiro frame do próximo. Referenciar o vídeo completo pode preservar contexto, mas também alterar escala e props.
- O resultado depende mais da separação de funções entre referências do que do número de imagens carregadas. Identidade, layout, estilo, cenário, voz e movimento devem ter controlos explícitos e não concorrentes.
- A página oficial do OpenArt estava inconsistente em 6 de agosto de 2026: mostrava Seedance 2.5 como coming soon, mas também apresentava acesso, recursos e uma promoção unlimited. Confirme disponibilidade e preço na sua conta.
--what to try first
- Dê crédito a Dan Kieft pelo tutorial e pelo Cartoon Prompts.
- Escolha uma linguagem visual antes de criar personagens ou cenários.
- Para trabalho comercial, transforme referências em atributos próprios em vez de copiar a identidade visual de uma série conhecida.
- Crie uma mini style bible com forma, contorno, paleta, sombras, proporções, textura e expressões.
- Use uma folha limpa por personagem e mantenha roupa, acessórios e proporções fixos.
- Diga o papel de cada referência. Uma imagem de identidade não deve controlar pose, layout ou fundo.
- Inclua um retrato maior na folha para dar mais informação facial ao modelo de vídeo.
- Gere e aprove o frame inicial antes de gastar créditos em animação.
- Escreva cenas como uma timeline com beats observáveis e duração aproximada.
- Bloqueie o diálogo como texto exato e atribua cada fala a uma única personagem.
- Não sobrecarregue um shot de 13 segundos com demasiadas ações, falas ou mudanças de câmara.
- Use uma descrição vocal para direção geral e uma referência de áudio licenciada quando a consistência for prioritária.
- Não presuma que repetir o mesmo texto de voz produzirá a mesma voz. A geração é variável.
- Use o último frame do shot anterior como âncora visual para a continuação.
- Defina props com tamanho, mão, posição inicial e posição final.
- Reserve a referência de vídeo completo para movimento ou contexto que um frame isolado não consegue transmitir.
- Faça montagem num editor ou com uma ferramenta de concatenação controlada, depois normalize áudio e cor.
- Teste em resolução e duração económicas antes da versão final.
- Confirme direitos sobre rostos, vozes, imagens, personagens, música e referências carregadas.
- Nos termos atuais do OpenArt, uso comercial de outputs está associado ao nível Plus ou superior. Verifique sempre o plano e os termos vigentes.
Crédito, vídeo e estado da pesquisa
O tutorial incorporado foi publicado por Dan Kieft. A demonstração, as personagens Dan e Vinny e o site Cartoon Prompts são trabalho do criador. O título público verificado no YouTube é How To Make AI Cartoon Animation Videos of Yourself, embora a descrição use Learn How To Make AI Cartoon Animations.
A análise usa a transcrição integral fornecida pelo utilizador, o vídeo original, o Cartoon Prompts, a documentação do OpenArt, os termos do OpenArt e a documentação de voz da ElevenLabs. A pesquisa foi atualizada em 6 de agosto de 2026.
Os resultados de imagem, vídeo e voz descritos pelo criador são observações de uma demonstração. Duração, créditos, qualidade e disponibilidade podem mudar por modelo, plano, região e data.
A resposta curta: cartoon com IA é um pipeline, não um botão
Sim, é possível transformar uma fotografia ou personagem original num pequeno episódio cartoon sem desenhar cada frame. Porém, o método eficaz continua a ter decisões de direção: uma estética coerente, uma folha por personagem, um frame de cena aprovado, uma voz fixa, uma timeline e uma estratégia de continuidade.
A IA resolve ilustração, transformação, movimento e parte do áudio. O criador continua responsável por design, blocking, ritmo, seleção de takes, montagem, direitos e controlo de qualidade.
A grande ideia do vídeo não é escolher um único modelo vencedor. É separar cada problema e dar-lhe uma referência própria.
O mapa de cinco etapas
Dan organiza o processo em cinco passos: estilo, personagens, localização ou cena, vozes e animação. Esta ordem reduz retrabalho porque cada output aprovado se torna input da fase seguinte.
Estilo define a gramática. A folha define identidade. O frame de episódio resolve composição. A voz define performance. A animação acrescenta tempo, movimento e diálogo.
Se uma fase ainda está instável, não avance. Um rosto inconsistente no character sheet ficará mais difícil de corrigir depois de animar treze segundos com duas personagens e áudio.
1. Escolher uma linguagem visual que possa repetir
O vídeo mostra exemplos inspirados em séries reconhecíveis e escolhe linguagens diferentes para demonstrar a amplitude do processo. Isso é útil para estudo, mas uma produção própria ganha valor quando traduz referências em decisões formais.
Em vez de depender do nome de uma série, descreva a estética: silhuetas geométricas, contorno preto irregular, cores planas, uma sombra dura, olhos pequenos, cabeças ligeiramente grandes, fundos simplificados e poses com leitura imediata.
Guarde estas escolhas numa style bible. A mesma descrição deve aparecer na folha de personagem, no frame da cena e no vídeo, com poucas alterações entre shots.
Cartoon Prompts: 35 linguagens e um template de três painéis
O Cartoon Prompts apresenta atualmente 35 estilos emparelhados, 70 character sheets, 35 episode frames e 105 imagens no total. É uma versão mais extensa do recurso de 30+ estilos mencionado na gravação.
A página permite comparar Dan, Vinny e cenas, filtrar linguagens 2D, 3D e outras, copiar o prompt de cada G-panel e descarregar o template 4K vazio.
Use o website para estudar a estrutura e obter os recursos de Dan. O prompt pack deste artigo é uma adaptação original, com uma linguagem visual fictícia e neutra, para não republicar integralmente o texto do criador.
2. Construir a folha com duas referências
O setup básico precisa de uma imagem da personagem e do template vazio de três painéis. No OpenArt, a referência de personagem entra como primeiro input e o G-panel como segundo.
A instrução deve ser inequívoca: a primeira imagem controla rosto, idade, corpo, roupa e acessórios. A segunda controla apenas as três colunas, divisórias e fundo. Não deve transferir pessoas, poses ou styling do template.
No tutorial, Dan usa GPT Image 2 em 16:9 e qualidade alta. A página oficial do Cartoon Prompts diz que os prompts foram otimizados para GPT Image 2, mas outros modelos podem funcionar se aceitarem referências e composição estruturada.
O que cada painel deve resolver
Uma boa folha não é apenas uma colagem de poses. Cada painel responde a uma pergunta que o vídeo terá de resolver mais tarde.
Um painel mostra corpo e roupa de frente, outro mostra a personagem completa de costas e o terceiro dá prioridade ao rosto e à parte superior do corpo em três quartos. Dan prefere um retrato maior ao simples close-up de uma cabeça com chapéu porque o modelo recebe mais informação facial, cabelo, ombros e gola.
A personagem deve ser a mesma nos três painéis. Bloqueie altura relativa, proporção da cabeça, comprimento dos membros, paleta da roupa, acessórios e expressão neutra.
Identidade e layout não são a mesma referência
A separação de papéis é um princípio central deste workflow. Se a imagem de referência controla tudo, o modelo pode copiar pose, painel, fundo ou enquadramento quando só precisava do rosto.
No prompt da cena, Dan especifica que as folhas existem apenas para character design. O output não deve repetir divisórias, poses, fundos brancos nem a composição da folha.
A regra pode ser reutilizada para qualquer produção: cada referência tem uma função positiva e uma lista curta de coisas que não controla.
3. Gerar o frame da primeira cena
A demonstração combina a folha de Dan com a de Vinny e pede um frame de episódio 16:9 numa cozinha doméstica à noite. Dan está ao computador e Vinny aparece atrás dele.
Este frame é a ponte entre design e animação. Resolve posição, escala relativa, luz, fundo, roupa, direção do olhar e distância de câmara antes de existir movimento.
Descarregue a imagem aprovada e preserve o ficheiro original. Não comece o vídeo a partir de uma variação quase certa, porque a animação pode amplificar pequenos erros de identidade ou escala.
A anatomia do prompt de frame
O prompt demonstrado tem sete blocos úteis: deliverable, referência, cena, câmara, estética, locks e avoid. A ordem ajuda a distinguir o que está a ser criado do que cada imagem apenas informa.
Deliverable define um único frame 16:9. O mapa de referências liga nomes a identidades. Cena descreve quem está onde e a fazer o quê. Câmara fixa plano e altura. Estética repete a style bible. Locks preservam roupa e proporções. Avoid elimina painéis, personagens extra, texto e logótipos.
Use negativos concretos. Uma lista enorme de defeitos genéricos compete com as instruções da cena e não substitui referências limpas.
Câmara simples dá mais espaço à atuação
Dan usa um plano médio aberto, estável e à altura dos olhos. Também bloqueia zooms e cortes na animação inicial.
Esta opção é especialmente adequada a diálogo cartoon. Com a composição resolvida no primeiro frame, o modelo pode concentrar-se em boca, olhos, mãos e timing em vez de reinventar o enquadramento.
Adicione movimento de câmara apenas quando tem função narrativa. Cada pan, dolly ou corte extra aumenta o risco de mudar o fundo, a escala e a posição relativa das personagens.
4. Escolher o modelo de vídeo pelo shot
O tutorial menciona Seedance 2.0, Seedance 2.5 e Hailuo 3 dentro do OpenArt. A descrição também cita Kling como alternativa. Dan considera que a simplicidade gráfica do cartoon pode permitir usar um modelo mais económico em alguns shots.
A página atual do OpenArt anuncia Seedance 2.5 com texto para vídeo, imagem para vídeo, start/end frames, até 50 referências multimodais e áudio nativo. No entanto, a própria página ainda exibia coming soon em 6 de agosto de 2026, enquanto outras áreas mostravam acesso e promoção.
Escolha pela função: um plano de diálogo simples pode não precisar do modelo mais caro. Uma interação física com três personagens, fala e prop beneficia de melhor aderência, mais referências e edição localizada, se essas opções estiverem realmente ativas na sua conta.
Start/end frame ou texto com referências?
Dan começa no modo de start/end frame, mas inicialmente carrega apenas o frame inicial. Isto dá ao modelo uma composição de partida sem obrigar um destino visual específico.
Use start e end frame quando o estado final é importante: uma personagem termina em cima da mesa, um objeto muda de mão ou a câmara tem de chegar a uma composição concreta.
Use texto com referências quando precisa de liberdade para descobrir blocking e movimento. Para shots de diálogo, um frame inicial forte e uma timeline simples costumam ser suficientes para o primeiro teste.
Escrever uma timeline de 13 segundos
A cena inicial do tutorial é planeada para treze segundos. O prompt distribui ação e fala ao longo do tempo em vez de apresentar um parágrafo sem ritmo.
Divida o shot em três ou quatro beats: estado inicial, primeira fala, reação e fecho. Escreva apenas ações visíveis. Termos como fica nervoso são ambíguos, enquanto desvia o olhar, aperta o copo e responde em voz baixa são observáveis.
A duração precisa de caber na fala. Leia o diálogo em voz alta antes de gerar e deixe margem para reação, respiração e movimento de boca.
Bloquear diálogo, ordem e sobreposição
O tutorial pede diálogo exato, sem paráfrase, sem sobreposição e sem pausas adicionais. Cada fala é atribuída pelo nome da personagem.
Separe texto falado de direção de atuação. Coloque a fala entre aspas e descreva gesto, expressão e timing fora das aspas. Isso reduz a possibilidade de o modelo vocalizar instruções ou atribuir uma frase à pessoa errada.
Se a cena contém duas vozes, bloqueie também quem permanece em silêncio durante cada beat. Uma reação não precisa de diálogo para ser legível.
Método de voz 1: descrição textual reutilizável
O primeiro método repete o mesmo voice prompt em cada geração. O exemplo descreve altura, textura, energia, cadência e atitude de uma voz alienígena.
A documentação de Voice Design da ElevenLabs recomenda atributos como língua, idade, género, qualidade, persona, emoção, timbre, ritmo e entrega. A mesma taxonomia é útil mesmo quando a voz é gerada diretamente pelo modelo de vídeo.
Uma descrição textual cria uma família de performances, não uma impressão digital. Dan mostra três outputs semelhantes, mas reconhece que a voz muda entre gerações. Use este método quando direção geral é suficiente.
Método de voz 2: referência de áudio autorizada
Para consistência mais forte, Dan gera cada fala com uma voz selecionada e carrega esse áudio como referência do shot. A demonstração usa uma voz de cientista excêntrico na ElevenLabs.
A voz pode vir da sua própria gravação, de Voice Design, de uma biblioteca com licença adequada ou de uma clonagem consentida. Use o mesmo voice ID, modelo, definições e qualidade de gravação em todos os diálogos.
A documentação da ElevenLabs confirma que a geração é não determinística. Mesmo com os mesmos sliders podem existir variações. A referência melhora a âncora, mas edição, normalização e escolha de takes continuam necessárias.
Quando a interface pede vídeo em vez de áudio
No fluxo mostrado, a referência é aceite como vídeo. Dan coloca o áudio num MP4 com fundo preto para evitar que a componente visual influencie o cartoon.
Pode fazer essa conversão num editor, com FFmpeg ou num ambiente de código que tenha ferramentas multimédia. Um chatbot só consegue converter o ficheiro se tiver acesso real ao upload e a uma ferramenta de processamento, por isso confirme o output em vez de assumir que a tarefa foi executada.
Identifique cada ficheiro com personagem, idioma, intenção e número de take. Não use gravações de terceiros sem autorização explícita para síntese ou clonagem.
5. Construir uma cena com três personagens
Na segunda parte, Dan combina as folhas de Dan, Vinny e um mob boss, mais o frame da cena anterior como referência de contexto.
Primeiro gera o frame inicial. Depois edita a mesma imagem para criar o frame final, com Vinny em cima da secretária após uma ação cómica curta. Os dois estados são enviados ao Seedance.
O prompt de vídeo repete timeline, vozes e controlos de áudio. A ação principal deve ser singular e legível. Três personagens, fala, contacto físico e mudança de posição já formam um shot de elevada complexidade.
Continuidade A: último frame para primeiro frame
O método preferido no tutorial é exportar o último frame do shot anterior e usá-lo como primeiro frame do seguinte. Marque o novo pedido como continuity shot.
Repita as identidades, roupa, posições, escala, props e direção da luz. Depois descreva apenas o que muda. Esta abordagem reduz a distância visual entre shots e dá ao modelo um ponto de partida inequívoco.
Inspecione o frame extraído. Motion blur, boca a meio de uma palavra ou mãos deformadas não são uma boa base. Se necessário, escolha um frame estável imediatamente anterior ou corrija a imagem antes de continuar.
Continuidade B: vídeo anterior como referência
A alternativa é carregar o vídeo anterior inteiro e pedir uma continuação. Isso oferece movimento, cadência e mais contexto do que um frame isolado.
No teste, a técnica é menos previsível. Um objeto que estava muito grande passa a pequeno no shot seguinte. A referência transmite a ideia do prop, mas não fixa necessariamente escala e posição.
Use vídeo completo quando o movimento anterior é indispensável. Para identidade, posição e escala, mantenha também um frame limpo ou uma imagem de prop dedicada. Mais referências só ajudam quando os seus papéis não entram em conflito.
Por que props mudam de tamanho
Um prop sem referência própria é reconstruído a cada geração. Palavras como caneta grande não definem comprimento relativo, espessura, cor, orientação e relação com a mão.
Defina a escala por comparação: a caneta mede metade da largura do torso de Vinny, começa na mão direita, aponta para cima e termina sobre a mesa junto ao portátil. Se o objeto for narrativamente importante, crie uma imagem de referência só para ele.
Bloqueie também o número de objetos. Exatamente uma caneta é mais verificável do que mantém a caneta consistente.
Montagem, áudio e acabamento
Dan sugere juntar os shots no Premiere Pro ou pedir a um ambiente com ferramentas multimédia para combinar os vídeos. O princípio é simples: concatene os takes aprovados e não regenere tudo só para alterar a montagem.
Depois normalize o volume das vozes, reduza diferenças de ruído, acrescente room tone, reveja lip-sync, aplique transições apenas quando necessárias e faça uma passagem de cor para aproximar planos.
Guarde cada shot separado, o frame inicial, o frame final, o prompt, as referências e a versão da voz. Esta organização torna uma correção local muito mais barata do que reconstruir o episódio.
Promoção, créditos e disponibilidade
A descrição do vídeo oferece até dez dias de Seedance 2.5 unlimited através de um link de Dan Kieft. É uma promoção afiliada e temporal. Confirme duração, modelos elegíveis, fair-use, renovação e preço antes de aderir.
O tutorial não apresenta um orçamento total para o episódio. A decisão económica deve ser feita por shot: folhas de personagem, frames de cena, tentativas de vídeo, voz, upscale e pós-produção.
A página oficial do OpenArt permite alterações a preços, limites e disponibilidade. Faça primeiro um teste curto e guarde uma margem para versões falhadas.
Direitos de personagens, estilos e vozes
Use fotografias, personagens, vozes, guiões, músicas e imagens que criou ou licenciou. Uma transformação visual não elimina direitos de imagem, privacidade, publicidade, marca ou copyright.
Para uma série comercial, desenvolva uma estética própria em vez de depender do nome e dos elementos distintivos de uma franquia. Evite personagens, logótipos, frases, roupas e cenários reconhecíveis de terceiros.
Os termos do OpenArt, atualizados em 30 de julho de 2026, permitem uso comercial de outputs no nível Plus ou superior, sujeito aos termos e à lei. Também proíbem conteúdo que infrinja propriedade intelectual e exigem direitos sobre uploads. Verifique a versão vigente antes de publicar.
Na voz, obtenha consentimento documentado. A ElevenLabs declara que clonagem sem permissão não é autorizada e exige verificação adicional para Professional Voice Cloning.
Workflow repetível para um episódio curto
Escreva uma premissa de uma frase e divida-a em três shots. Crie a style bible. Aprove uma folha por personagem. Gere um frame para cada shot. Grave ou desenhe as vozes. Só depois anime.
Comece pelo shot mais simples para validar identidade e voz. Passe para interação entre personagens. Termine com a cena complexa e use o último frame de cada take como base do seguinte.
Revise por categorias: identidade, roupa, composição, movimento, props, voz, lip-sync, continuidade, texto, áudio e direitos. Aprovado não significa perfeito, significa suficientemente estável para a função editorial daquele shot.
Veredicto: um sistema acessível com decisões de direção reais
O tutorial de Dan Kieft mostra um caminho claro para quem não desenha: transformar referências próprias numa biblioteca visual, resolver as cenas como stills e usar vídeo generativo para atuação e diálogo.
O maior ganho não vem de imitar uma série famosa. Vem da disciplina de referências, de uma style bible repetível e de continuidade shot a shot.
Use Cartoon Prompts para aprender a estrutura, mas construa personagens, estética e vozes que lhe pertencem. Assim o mesmo workflow deixa de ser uma demonstração e torna-se uma base de produção.
Prompt kit · Cartoon original com personagens e voz consistentes
Os templates abaixo são adaptações originais baseadas nas técnicas observadas no vídeo. Não reproduzem os prompts integrais do Cartoon Prompts. Substitua os campos entre chavetas, use referências autorizadas e mantenha uma estética própria para trabalho comercial.
Prompt pack credit: Dan Kieft.
01 · Style bible original
Converta referências dispersas numa gramática visual própria.
Cria uma style bible curta para uma série cartoon original chamada {TÍTULO}.
PREMISSA
{PREMISSA}
PÚBLICO E TOM
{PÚBLICO}, {TOM}
REFERÊNCIAS ABSTRATAS
{DESCREVA ÉPOCA, TÉCNICA E SENSAÇÃO SEM USAR NOMES DE ARTISTAS, ESTÚDIOS OU SÉRIES}
DEFINE
1. Silhuetas e proporções.
2. Forma dos olhos, nariz, boca, mãos e cabelo.
3. Espessura e variação do contorno.
4. Paleta com 8 cores e códigos HEX.
5. Regra de luz e máximo de tons de sombra.
6. Textura do preenchimento e do fundo.
7. Complexidade de cenários e props.
8. Cinco expressões recorrentes.
9. Regras de movimento e deformação.
10. Oito elementos proibidos para evitar deriva.
O resultado deve ser visualmente distintivo, coerente e livre de personagens, logótipos ou traços exclusivos de franquias existentes.02 · Folha G-panel de personagem
Use a personagem como identidade e o template apenas como layout.
OBJETIVO
Cria uma folha de personagem 4K, 16:9, com exatamente três painéis para {NOME}.
MAPA DE REFERÊNCIAS
@image1 controla exclusivamente identidade, idade aparente, corpo, cabelo, roupa e acessórios da personagem.
@image2 controla exclusivamente o layout vazio: três painéis verticais iguais, divisórias e fundo neutro.
Não copiar pessoas, poses, cores ou estilo de @image2.
LINGUAGEM VISUAL
Cartoon editorial original com silhuetas geométricas, contorno preto ligeiramente irregular, cor plana de baixa saturação, uma sombra dura, olhos pequenos e gestos legíveis.
PAINEL ESQUERDO
Corpo e roupa vistos de frente, do pescoço aos pés, sem cabeça. Mostrar claramente camadas, calçado e acessórios.
PAINEL CENTRAL
Vista completa de costas, da cabeça aos pés, pose neutra, sem corte.
PAINEL DIREITO
Retrato de cabeça e ombros em três quartos, expressão neutra, margem limpa de 8% em todos os lados.
LOCKS
A mesma personagem, proporções, roupa, cores e acessórios nos três painéis.
EVITAR
Poses extra, texto, etiquetas, logótipos, props, cenário, sobreposição entre painéis, membros duplicados, troca de roupa ou mudança de idade.03 · Manifesto de referências
Declare o que cada input controla e o que não pode copiar.
REFERÊNCIAS E FUNÇÕES
@character_a = identidade, corpo, roupa e acessórios de {NOME A}. Não controla pose, layout ou fundo.
@character_b = identidade, corpo, roupa e acessórios de {NOME B}. Não controla pose, layout ou fundo.
@location = arquitetura, mobiliário, paleta e direção da luz. Não controla personagens.
@prop = forma, escala, cor e detalhes de {OBJETO}. Não controla mão ou posição.
@style = apenas contorno, preenchimento, sombras e textura. Não copiar personagem, marca, texto ou composição.
PRIORIDADE
Identidade > roupa > geografia > prop > composição > estilo.
Não misturar rostos, roupas ou acessórios. Não reproduzir painéis de character sheet no frame final. Se duas referências entrarem em conflito, seguir a prioridade e preservar o papel exclusivo de cada uma.04 · Frame de episódio
Resolva a composição antes de gerar vídeo.
DELIVERABLE
Um único frame de episódio cartoon original, 16:9, sem painéis.
REFERÊNCIAS
@character_a é {NOME A}. @character_b é {NOME B}. Usar apenas para design e identidade.
CENA
{NOME A} está {POSIÇÃO E AÇÃO}. {NOME B} está {POSIÇÃO E AÇÃO}. A cena decorre em {LOCAL}, à {HORA}, com {TRÊS ELEMENTOS DE FUNDO}.
CÂMARA
Plano médio aberto, estável, altura dos olhos, lente normal. {NOME A} ocupa o terço esquerdo e {NOME B} o terço direito. Ambos completamente legíveis e com eyeline coerente.
ESTÉTICA
Aplicar a style bible de {TÍTULO}: {RESUMO DE FORMA, CONTORNO, COR E SOMBRA}.
LOCKS
Preservar rosto, proporções, roupa, acessórios, escala relativa e direção da luz.
EVITAR
Character sheet, múltiplos painéis, personagens extra, texto, legendas, logótipos, boca aberta, pose extrema, membros duplicados, fundo vazio ou olhar para a câmara.05 · Shot de diálogo com 13 segundos
Estruture ação, fala e reação por tempo.
FORMATO
Shot cartoon de 13 segundos, 16:9, 1080p, baseado exatamente no frame inicial. Câmara fixa, sem zoom, sem corte e sem mudança de lente.
CONTINUIDADE
Manter personagens, roupa, proporções, fundo, luz, posições e escala do primeiro frame.
TIMELINE
00:00-00:03: {NOME A} executa {AÇÃO CURTA}. {NOME B} observa em silêncio.
00:03-00:07: {NOME A} olha para {NOME B} e diz exatamente: "{FALA A}".
00:07-00:09: pausa de reação. {NOME B} faz {GESTO VISÍVEL}, sem falar.
00:09-00:12: {NOME B} diz exatamente: "{FALA B}".
00:12-00:13: ambos terminam em {ESTADO FINAL}.
ÁUDIO
Sem paráfrase, falas extra, sobreposição, narrador ou música a cobrir diálogo. Ambiente discreto de {LOCAL}.
EVITAR
Movimento de câmara, troca de posição, identidade variável, boca ativa na personagem silenciosa, texto no ecrã, props novos, cortes ou transições.06 · Lock de diálogo exato
Separe texto falado de direção de atuação.
DIÁLOGO BLOQUEADO
Speaker A: {NOME A}
Texto exato: "{FALA A}"
Atuação não falada: {EMOÇÃO, EXPRESSÃO, GESTO E RITMO}
Durante esta fala, {NOME B} permanece em silêncio e reage com {REAÇÃO}.
Speaker B: {NOME B}
Texto exato: "{FALA B}"
Atuação não falada: {EMOÇÃO, EXPRESSÃO, GESTO E RITMO}
Durante esta fala, {NOME A} permanece em silêncio e reage com {REAÇÃO}.
CONTROLO
Pronunciar apenas o texto entre aspas. Não narrar direções, não parafrasear, não trocar speakers, não repetir palavras, não criar interjeições e não sobrepor vozes.07 · Voice prompt textual
Crie uma direção vocal repetível, sem prometer identidade perfeita.
VOICE LOCK PARA {NOME}
Língua nativa: {LÍNGUA E VARIANTE REGIONAL}.
Idade vocal: {FAIXA}. Registo: {GRAVE/MÉDIO/AGUDO}.
Persona: {2 A 5 PALAVRAS}.
Emoção base: {2 A 3 ADJETIVOS}.
Timbre: {TEXTURA, RESSONÂNCIA E CLAREZA}.
Cadência: {VELOCIDADE, RITMO E PADRÃO DE PAUSAS}.
Entrega: {DISTÂNCIA, ENERGIA, ARTICULAÇÃO E INTONAÇÃO}.
Qualidade: gravação de estúdio limpa, sem reverb, ruído ou distorção.
Aplicar esta descrição a todas as falas de {NOME}. Manter língua, idade, timbre e cadência estáveis. Variar apenas a emoção indicada em cada beat.08 · Manifesto de referência vocal
Associe cada ficheiro autorizado a uma única personagem.
REFERÊNCIAS DE VOZ
@voice_a pertence exclusivamente a {NOME A}. Usar identidade vocal, sotaque, timbre e cadência. Ignorar qualquer imagem do ficheiro de referência.
@voice_b pertence exclusivamente a {NOME B}. Usar identidade vocal, sotaque, timbre e cadência. Ignorar qualquer imagem do ficheiro de referência.
FALAS
{NOME A}: "{FALA A}"
{NOME B}: "{FALA B}"
REGRAS
Não trocar, fundir ou duplicar vozes. Sem narrador. Sem falas adicionais. Preservar a língua e pronúncia dos nomes. Manter volume percebido semelhante. As referências foram gravadas ou licenciadas com consentimento para este projeto.09 · Cena complexa com start e end frame
Defina uma mudança principal entre dois estados aprovados.
ENTRADAS
Start frame = composição inicial aprovada.
End frame = composição final aprovada.
OBJETIVO
Transição cartoon contínua de {DURAÇÃO} segundos entre os dois estados, sem alterar identidade, roupa, cenário, escala, luz ou estilo.
AÇÃO PRINCIPAL
{NOME A} executa exatamente uma ação: {AÇÃO}. {NOME B} reage com {REAÇÃO}. {NOME C} permanece em {POSIÇÃO} e diz: "{FALA}".
TRAJETÓRIA
{DESCREVA POSIÇÃO INICIAL, CONTACTO, MOVIMENTO E POSIÇÃO FINAL}. O movimento termina exatamente na pose do end frame.
CÂMARA E ÁUDIO
Câmara fixa. Sem corte, zoom ou rotação. Fala exata, uma voz de cada vez. Um efeito sonoro curto em {MOMENTO}, sem impacto realista ou violência gráfica.
EVITAR
Frames intermédios com personagem duplicada, teletransporte, mudança de tamanho, contacto repetido, prop novo, deformação facial ou troca de posição.10 · Continuação pelo último frame
Use o estado final anterior como nova âncora.
CONTINUITY SHOT
O primeiro frame é o último frame aprovado do shot anterior. Preservar sem alterações: identidades, roupa, posição, escala relativa, cenário, props, luz, paleta e direção dos olhares.
O QUE MUDA
Após 1 segundo de continuidade imóvel, {NOME A} faz {AÇÃO}. {NOME B} responde com {AÇÃO OU FALA}. {PROP} permanece {POSIÇÃO E ESCALA}.
CÂMARA
Manter o mesmo eixo, altura e lente. {MOVIMENTO OPCIONAL MUITO SIMPLES}.
ESTADO FINAL
Terminar com {COMPOSIÇÃO CLARA PARA O SHOT SEGUINTE}.
Não reiniciar a cena, não trocar lados, não espelhar o fundo, não reapresentar personagens e não alterar objetos já existentes.11 · Continuação com vídeo de referência
Use movimento anterior sem deixar o vídeo controlar tudo.
@previous_video é referência exclusiva para cadência, velocidade de movimento e direção da ação anterior.
@last_frame é referência obrigatória para identidade, posição, escala, roupa, cenário e props.
@prop controla forma e tamanho de {OBJETO}.
CONTINUAÇÃO
Começar exatamente no estado de @last_frame. Prosseguir a ação de @previous_video durante {DURAÇÃO}, sem repetir o beat anterior.
LOCK DE PROP
Existe exatamente um {OBJETO}. Mede {COMPARAÇÃO DE ESCALA}, começa em {POSIÇÃO}, permanece na mão {MÃO} e termina em {POSIÇÃO FINAL}.
Não herdar personagens, texto, cenário ou artefactos visuais do vídeo de referência. Não mudar escala, direção ou número de props.12 · Relatório de continuidade e qualidade
Transforme o primeiro corte numa lista objetiva de correções.
Analisa o episódio cartoon e compara-o com os frames, folhas de personagem, voice locks e prompts. Para cada problema, devolve: TIMECODE | SHOT | CATEGORIA | ESPERADO | OBSERVADO | SEVERIDADE | CORREÇÃO CATEGORIAS Identidade, proporções, roupa, cor, cenário, eixo, eyeline, prop, mãos, movimento, diálogo, voz, lip-sync, silêncio, ruído, texto, flicker e direitos. CLASSIFICA A CORREÇÃO Aceitar, cortar, corrigir áudio, retocar frame, edição localizada, regenerar shot ou rever referência. No fim, cria: 1. Lista dos cinco bloqueios mais urgentes. 2. Ordem de montagem recomendada. 3. Nomes dos ficheiros que faltam. 4. Checklist de publicação e licenças. 5. Prompt revisto apenas para o shot com maior severidade.
Video Timestamps
FAQ
Quem criou o tutorial de animações cartoon com IA?
Dan Kieft. O vídeo incorporado e o website Cartoon Prompts são creditados ao criador.
Qual é o título correto do vídeo?
O título público verificado no YouTube é How To Make AI Cartoon Animation Videos of Yourself. A descrição começa com Learn How To Make AI Cartoon Animations.
Preciso de saber desenhar?
Não para repetir este workflow. Ainda precisa de tomar decisões de design, selecionar referências, rever consistência e editar os resultados.
Quais são as cinco etapas?
Escolher estilo, criar personagens, gerar a localização ou cena, fixar vozes e animar os shots.
Quantos estilos existem no Cartoon Prompts?
A versão verificada em 6 de agosto de 2026 apresenta 35 linguagens visuais, 70 folhas de personagem e 35 frames de episódio.
O que preciso para criar a character sheet?
Uma imagem de referência da personagem, o template vazio de três painéis e um prompt que separe identidade de layout.
Qual modelo de imagem Dan usa?
Dan demonstra GPT Image 2 no OpenArt em 16:9 e qualidade alta. O Cartoon Prompts também declara que os prompts foram otimizados para esse modelo.
Posso usar outro modelo de imagem?
Sim, se aceitar referências, respeitar layout e mantiver identidade. Espere ajustar o prompt e a estrutura dos painéis.
Por que existe um retrato maior na folha?
Para fornecer mais detalhe de rosto, cabelo, ombros e roupa superior ao modelo de vídeo, melhorando a âncora de identidade.
A folha de personagem deve aparecer no frame final?
Não. O prompt deve dizer que a folha controla apenas design e identidade, nunca painéis, pose, fundo ou composição.
Qual formato de frame é usado?
O tutorial trabalha em 16:9. O primeiro frame é um plano médio aberto e estável, adequado a diálogo entre personagens.
Qual duração tem a primeira cena?
Dan demonstra uma timeline de 13 segundos e escolhe 1080p para a geração mostrada.
É melhor usar start/end frames?
Use ambos quando o estado final precisa de ser exato. Para diálogo simples, um frame inicial forte pode dar liberdade suficiente ao movimento.
Seedance 2.0 é suficiente para cartoon?
Pode ser suficiente para shots simples, segundo a experiência do criador. Compare custo e aderência com 2.5 no seu próprio material antes de decidir.
Como manter a voz parecida entre gerações?
Repita uma descrição vocal detalhada com língua, idade, timbre, emoção e cadência. Produz semelhança, não identidade perfeita.
Como obter consistência vocal mais forte?
Use a mesma voz licenciada ou consentida para gerar cada linha e carregue o áudio como referência em todos os shots da personagem.
Por que converter áudio para MP4?
No fluxo mostrado, a referência era aceite como vídeo. Um MP4 com fundo preto transporta o áudio sem introduzir uma imagem útil para copiar.
Claude ou ChatGPT conseguem converter o áudio?
Apenas quando o ambiente permite upload e execução de ferramentas multimédia. Um editor ou FFmpeg é uma alternativa verificável. Confirme sempre o ficheiro produzido.
Qual método de continuidade funciona melhor?
No tutorial, usar o último frame do shot anterior como primeiro frame do seguinte é o método mais previsível.
Por que o objeto muda de tamanho entre shots?
Porque a referência transmite o conceito, mas não fixa automaticamente escala e posição. Descreva medidas relativas e use uma referência dedicada para props importantes.
Preciso do Premiere Pro?
Não. Pode montar num editor da sua preferência ou usar uma ferramenta de concatenação como FFmpeg. O importante é preservar shots e áudio separadamente.
Quanto custa criar um episódio?
O vídeo não fornece um total. O custo inclui character sheets, frames, várias tentativas de vídeo, voz, upscale e pós-produção, e varia por plano.
A promoção de dez dias unlimited é permanente?
Não deve ser tratada como permanente. É uma oferta afiliada descrita no vídeo. Confirme elegibilidade, duração, renovação e fair-use na página atual.
Posso usar os outputs do OpenArt comercialmente?
Os termos verificados em 6 de agosto de 2026 associam uso comercial ao nível Plus ou superior e exigem conformidade com a lei e os direitos de terceiros. Verifique os termos atuais.
Posso copiar o estilo de uma série conhecida?
Para estudo, pode analisar atributos visuais. Para publicação comercial, desenvolva uma gramática própria e evite personagens, marcas e elementos distintivos protegidos.
Posso clonar a voz de outra pessoa?
Só com direitos e consentimento adequados. A ElevenLabs declara que clonagem sem permissão não é autorizada e usa verificação adicional em clonagem profissional.
--sources and credits
- Dan Kieft · Vídeo original no YouTube
- Dan Kieft · Canal oficial
- Cartoon Prompts · Biblioteca e template G-panel
- OpenArt · Seedance 2.5, link da promoção de Dan Kieft
- OpenArt · Página oficial do Seedance 2.5
- OpenArt · Guia oficial de prompts para Seedance 2.5
- OpenArt · GPT Image 2
- OpenArt · Termos de Serviço, atualizados em 30 de julho de 2026
- ElevenLabs · Voice Design
- ElevenLabs · Text to Speech
- ElevenLabs · Voice Cloning
- FFmpeg · Documentação oficial