Já imaginou transformar uma foto comum em uma cena que parece ter saído de um videogame open-world de nova geração?
Com uma foto sua, um prompt detalhado e ferramentas de inteligência artificial como Google Gemini e Google Flow, é possível criar um personagem 3D realista inserido em um cenário tropical urbano, com iluminação de pôr do sol, palmeiras, reflexos de neon e atmosfera cinematográfica.
E o processo não precisa terminar na imagem.
Depois de gerar o frame principal, você pode utilizar a própria imagem como referência para criar um pequeno vídeo cinematográfico de aproximadamente 8 segundos, incluindo movimento de câmera, vento nas roupas, luzes da cidade, um carro passando ao fundo e até trilha instrumental.
O ponto mais importante deste método está em uma característica que muitos prompts ignoram: preservar a identidade da pessoa da fotografia original.
A seguir, você encontra o processo completo e os prompts prontos para copiar.
Observação: o objetivo é criar uma estética genérica de game AAA tropical de mundo aberto, e não reproduzir material oficial, personagens, logotipos ou interfaces de GTA VI ou de qualquer outro jogo.
O que você precisa para fazer o efeito
O processo começa de maneira simples:
- Escolha uma foto sua com boa resolução.
- Abra uma ferramenta compatível com geração ou edição de imagens por IA.
- Envie sua fotografia como referência.
- Cole o prompt de imagem apresentado abaixo.
- Gere algumas versões até encontrar o resultado mais próximo da identidade original.
- Use a melhor imagem como referência para a etapa de geração do vídeo.
Atualmente, os apps do Gemini permitem enviar uma imagem e solicitar alterações por meio de comandos em linguagem natural. O Google informa também que seus modelos de imagem trabalham com consistência de personagens e edição baseada em imagens enviadas pelo usuário.
Outra alternativa é o Google Flow, ambiente criativo do Google que combina ferramentas para geração e edição de imagens e vídeos. Entre os recursos atualmente apresentados pela plataforma estão modelos de imagem e o Veo 3.1 para vídeo.
A disponibilidade de modelos e recursos pode variar conforme país, plataforma e tipo de assinatura.
Por que um prompt simples de “me transforme em GTA” costuma falhar?
Um comando com apenas uma frase pode até gerar uma imagem bonita, mas normalmente deixa decisões demais para o modelo.
É aí que surgem problemas como:
- rosto diferente;
- pessoa aparentemente mais jovem;
- pele excessivamente lisa;
- mudança no formato do nariz;
- cabelo ou barba diferentes;
- proporções corporais alteradas;
- olhos artificiais;
- mãos deformadas;
- excesso de neon;
- aparência de ilustração ou pôster;
- cenário completamente diferente da fotografia original.
O prompt apresentado neste artigo trabalha justamente para reduzir essas alterações.
Em vez de pedir apenas um “estilo de videogame”, ele define separadamente identidade, composição, materiais, iluminação, cores, cenário e elementos proibidos.
Prompt GT6 para transformar sua foto em personagem de videogame
Envie primeiro a sua fotografia e, em seguida, cole o comando abaixo.
Prompt para gerar a imagem
Transform the provided image into a cinematic next-generation open-world videogame render with a modern tropical metropolitan atmosphere.
IDENTITY AND COMPOSITION PRESERVATION
Preserve the subject's exact identity and recognizable facial characteristics. Maintain the original:
- Facial structure and proportions
- Apparent age
- Skin tone and ethnicity
- Eye shape and eye color
- Nose, lips, jawline and eyebrows
- Hairstyle, hair color and hairline
- Body proportions
- Pose, gesture and facial expression
- Clothing, accessories and distinctive details
- Camera angle, framing and overall composition
Do not beautify, rejuvenate or reinterpret the person. The result must clearly depict the same individual, without changing their identity.
VISUAL DIRECTION
Create a highly polished, realistic 3D character render suitable for a modern AAA open-world video game.
Use:
- Physically based rendering and realistic materials
- Cinematic global illumination
- High dynamic range with controlled highlights
- Natural shadows, reflections and ambient light
- Detailed skin with pores, fine lines and subtle natural imperfections
- Realistic eyes with restrained reflections
- Natural hair strands and fabric textures
- Subtle game-character stylization while maintaining photographic realism
- Crisp primary details without artificial oversharpening
- Cinematic depth of field with the face remaining completely sharp
- High environmental detail and believable atmospheric depth
COLOR AND LIGHTING
Use a sophisticated tropical-metropolitan color palette inspired by contemporary Miami nightlife:
- Warm sunset or neon highlights
- Subtle teal and cyan shadows
- Coral, magenta and amber accents
- Vibrant but controlled saturation
- Realistic skin tones unaffected by the environmental color grading
- Premium cinematic contrast without crushed blacks or blown highlights
BACKGROUND
Preserve the original location and spatial arrangement, but upgrade its lighting, materials and environmental detail.
When compatible with the original scene, introduce subtle elements of a luxurious tropical coastal city, such as palm trees, contemporary architecture, distant neon signs, reflective streets, premium vehicles or a warm sunset glow.
These additions must remain secondary and must not distract from the subject.
STYLE LIMITS
The image must remain grounded, realistic and cinematic.
Do not create:
- Cartoon or comic-book artwork
- Illustrated loading-screen aesthetics
- Thick outlines or cel shading
- Exaggerated facial features or body proportions
- Plastic, waxy or excessively smooth skin
- Anime characteristics
- A generic or redesigned face
- Excessive neon lighting
- Artificially glowing eyes
- Distorted anatomy, hands or fingers
- Text, logos, watermarks or interface elements
NEGATIVE PROMPTS:
cartoon, comic book, cel shading, thick outlines, loading-screen illustration, GTA V poster style, exaggerated anatomy, altered identity, generic face, face replacement, beautified face, younger appearance, plastic skin, waxy skin, excessive skin smoothing, oversized eyes, artificial eyes, distorted hands, extra fingers, malformed anatomy, oversaturated neon, extreme contrast, blurry face, low-detail face, text, logo, watermark, HUD, game interface.
FINAL RESULT
Produce a believable cinematic frame featuring the original person reimagined as a character from a next-generation tropical open-world crime game.
The final image should feel immersive, premium and realistic, with subtle stylization, strong identity preservation and modern AAA production quality.
O segredo está na preservação da identidade
Uma das partes mais importantes do prompt aparece logo no início.
Em vez de simplesmente solicitar que a IA mantenha “o mesmo rosto”, o comando especifica individualmente características que não devem ser reinterpretadas:
- idade aparente;
- formato do rosto;
- olhos;
- nariz;
- lábios;
- mandíbula;
- sobrancelhas;
- cabelo;
- barba;
- tom de pele;
- corpo;
- pose;
- expressão;
- roupas;
- acessórios.
Também existe uma instrução explícita para não embelezar nem rejuvenescer a pessoa.
Isso é especialmente importante porque modelos generativos podem transformar pequenas imperfeições naturais em uma espécie de tratamento de beleza digital.
O objetivo aqui é outro: fazer a pessoa parecer um personagem tridimensional de um game AAA sem deixar de parecer ela mesma.
Como conseguir uma aparência realmente cinematográfica
A segunda camada do prompt controla a renderização.
Termos como physically based rendering, iluminação global, materiais realistas, reflexos naturais e alto alcance dinâmico direcionam o resultado para uma estética próxima de um frame produzido por uma engine moderna.
Ao mesmo tempo, o comando pede detalhes naturais na pele.
Isso ajuda a evitar aquele efeito de “boneco de cera” frequentemente associado a imagens de IA.
O rosto precisa continuar nítido enquanto o ambiente recebe profundidade de campo cinematográfica.
O resultado procurado não é uma fotografia comum e tampouco uma ilustração: é justamente essa região intermediária em que a imagem continua realista, mas apresenta uma leve estilização de personagem de videogame.
Miami, pôr do sol e neon — mas sem exagerar
A paleta também faz uma diferença enorme.
O prompt combina:
- laranja;
- âmbar;
- coral;
- magenta;
- ciano;
- teal.
São cores capazes de transmitir rapidamente uma atmosfera tropical e noturna.
Mas existe uma restrição importante: a pele da pessoa não deve receber a mesma coloração intensa do cenário.
Por isso o comando mantém tons de pele realistas e limita tanto a saturação quanto o contraste.
É a diferença entre uma cena cinematográfica e uma imagem completamente tomada por neon rosa e azul.
O prompt negativo ajuda a evitar os erros mais comuns
Outro elemento importante é a lista de negative prompts.
Ela funciona como uma relação explícita daquilo que você não deseja receber.
Entre os elementos excluídos estão:
- rosto genérico;
- troca de identidade;
- rejuvenescimento;
- pele plástica;
- olhos artificiais;
- mãos deformadas;
- dedos adicionais;
- anatomia incorreta;
- neon excessivamente saturado;
- rosto desfocado;
- textos;
- logos;
- marca-d’água;
- HUD ou elementos de interface.
Se a primeira tentativa apresentar algum defeito específico, você ainda pode acrescentar esse problema à lista antes de gerar novamente.
Gostou da imagem? Agora transforme o resultado em vídeo
A próxima etapa é usar a imagem final como referência para geração de vídeo.
O Google Flow é voltado justamente à criação audiovisual e atualmente apresenta suporte a geração de vídeo por modelos como o Veo 3.1, que inclui recursos de áudio nativo.
Para este exemplo, a proposta é um único plano cinematográfico curto.
Nada de cortes frenéticos.
O personagem praticamente não se movimenta. O dinamismo acontece principalmente no ambiente e no movimento lento da câmera.
Prompt para transformar a imagem em um vídeo de 8 segundos
Animate this image into a cinematic 8-second shot from a next-generation tropical open-world video game.
CAMERA MOVEMENT:
Create a very slow, smooth cinematic push-in toward the man, combined with subtle natural parallax between the foreground character, waterfront, palm trees and distant skyline.
Keep the camera stable and premium, without shaking or sudden movements.
CHARACTER:
The man remains silent, confident and composed, looking naturally toward the camera.
Add only subtle realistic micro-movements: gentle breathing, one natural blink and minimal movement of his jacket caused by the coastal breeze.
His mouth must remain completely closed and still throughout the entire video.
No talking, no lip movement, no exaggerated facial expression and no head turn.
Preserve his exact face, identity, bald head, beard, glasses, body proportions and clothing.
Do not morph or redesign the character.
ENVIRONMENTAL ANIMATION:
Palm leaves sway gently in the warm coastal breeze.
Neon lights pulse subtly across the buildings.
City lights and sunset colors reflect naturally on the water and wet pavement.
A sports car moves smoothly through the distant street, leaving restrained red and pink light reflections.
Add subtle atmospheric haze and a few distant city lights gradually turning on.
LIGHTING:
Maintain the cinematic sunset-to-night atmosphere with warm orange and magenta highlights, restrained teal shadows and realistic neon reflections.
Add a very subtle moving light reflection across the man’s jacket and glasses as the car passes in the background.
AUDIO:
No dialogue, no voice, no vocals and no character sounds.
Use an original instrumental 1980s Miami-inspired synthwave soundtrack: warm analog synthesizers, atmospheric pads, subtle electronic drums, deep retro bassline and a stylish nocturnal coastal-city mood.
The music should feel cinematic, sophisticated and energetic without becoming aggressive.
Include subtle environmental audio underneath the music: distant traffic, a light coastal breeze and quiet city ambience.
TIMING:
0–2 seconds:
Slow cinematic push-in begins; palm trees and water move subtly.
2–5 seconds:
Distant sports car passes; neon reflections travel across the wet street and briefly across the man’s glasses and jacket.
5–8 seconds:
City lights intensify slightly as the camera completes the push-in; finish on a sharp, confident close framing of the character.
CONSTRAINTS:
Single continuous shot.
No cuts, no transitions, no dialogue, no lip-sync, no camera shake, no fast zoom, no face distortion, no body deformation, no exaggerated movement, no additional people, no weapons, no violence, no text, no logos, no watermark and no interface elements.
The final video must remain realistic, immersive and consistent with the original image, with the polished visual quality of a modern AAA tropical open-world game.
Por que o vídeo usa movimentos tão discretos?
Existe uma razão para o personagem receber poucas animações.
Quanto mais movimentos complexos você solicita simultaneamente, maior é a chance de surgirem inconsistências entre os frames.
Por isso, neste prompt, o personagem faz basicamente três coisas:
- respira;
- pisca uma vez;
- tem a roupa levemente movimentada pelo vento.
O rosto permanece voltado para a câmera e a boca continua fechada.
Enquanto isso, o cenário produz a sensação de movimento por meio das palmeiras, água, luzes, reflexos, carro ao fundo e push-in da câmera.
É uma maneira de criar uma cena visualmente rica sem exigir que o personagem execute uma ação complexa.
Um detalhe faz toda a diferença: o roteiro dos 8 segundos
O prompt também divide a ação temporalmente.
De 0 a 2 segundos
A câmera começa uma aproximação lenta enquanto água e palmeiras apresentam movimentos discretos.
De 2 a 5 segundos
Um carro esportivo passa ao fundo e cria reflexos coloridos na rua, nos óculos e na roupa do personagem.
De 5 a 8 segundos
As luzes da cidade ficam um pouco mais presentes e a câmera termina próxima ao personagem.
É quase um pequeno storyboard embutido dentro do próprio prompt.
Em vez de simplesmente pedir “faça um vídeo cinematográfico”, você informa à IA o que deve acontecer e quando deve acontecer.
Como melhorar o resultado se o rosto mudar
Caso a imagem inicial esteja excelente, mas o vídeo comece a alterar o rosto, simplifique.
Retire movimentos desnecessários do personagem e reforce instruções como:
Preserve the exact facial identity from the reference image in every frame.
No facial morphing.
No identity drift.
Keep facial proportions, beard, glasses, skin texture and head shape unchanged throughout the entire shot.
Você também pode reduzir a movimentação do corpo e concentrar quase toda a animação no cenário.
Quando se trabalha com uma imagem de referência, consistência costuma ser mais importante do que quantidade de movimentos.
5 dicas para conseguir um resultado melhor
1. Comece com uma boa fotografia
Prefira uma foto nítida, bem iluminada e na qual as características do rosto estejam claramente visíveis.
2. Não tente mudar tudo de uma vez
Se o resultado estiver próximo do que você deseja, faça ajustes pontuais em vez de reescrever completamente o prompt.
3. Compare o rosto com a fotografia original
Uma imagem pode parecer excelente isoladamente e, ainda assim, ter modificado a pessoa. Compare olhos, nariz, mandíbula, cabelo ou barba e idade aparente.
4. Escolha a melhor geração antes de criar o vídeo
Não transforme uma imagem apenas “mais ou menos” em vídeo. Pequenos problemas do frame inicial podem ficar ainda mais visíveis quando ele é animado.
5. Use fotos que você tenha autorização para utilizar
Ao trabalhar com imagens de outras pessoas, considere direitos de imagem, consentimento e privacidade. O próprio Google orienta usuários de seus recursos generativos a observar direitos autorais e de privacidade ao gerar e publicar conteúdo.
Imagem e vídeo com o mesmo conceito
O interessante deste método é que os dois prompts foram pensados como partes de um único fluxo.
A imagem estabelece:
identidade + personagem + ambiente + iluminação + estética.
O vídeo acrescenta:
tempo + câmera + microanimações + movimento ambiental + áudio.
Isso ajuda a manter continuidade visual entre o frame original e a animação.
Em vez de pedir que o gerador de vídeo invente uma cena completamente nova, você começa com um visual previamente definido e usa essa imagem como base.
Copie, teste e adapte o GT6 Prompt
Este prompt não precisa ser utilizado exatamente da mesma maneira em todas as fotografias.
Uma foto em uma avenida pode receber arquitetura urbana e reflexos nas ruas.
Uma imagem próxima à praia pode enfatizar água, palmeiras e pôr do sol.
Um retrato em ambiente interno pode pedir uma transformação mais discreta do espaço para não destruir a composição original.
O princípio continua o mesmo: preservar primeiro, estilizar depois.
Quanto mais o modelo respeitar a identidade, a pose e a composição da fotografia original, mais convincente será a sensação de estar vendo aquela pessoa reimaginada como protagonista de um videogame AAA.
E, quando chegar à etapa do vídeo, menos pode ser mais: câmera lenta, pequenos movimentos, iluminação bem controlada e um ambiente vivo costumam produzir uma cena mais sofisticada do que uma sequência cheia de ações.
Criado por Daniel Kroll, da Simplifike.
Quer aprender a usar inteligência artificial de forma mais avançada e transformar essas ferramentas em um processo prático de criação e produtividade?
Conheça a Formação IA Pro Plus da Simplifike.
Fontes consultadas
- Google Gemini — documentação oficial sobre geração e edição de imagens.
- Google Flow — página oficial com os modelos e recursos disponíveis atualmente.
- Material-base e prompts fornecidos por Daniel Kroll/Simplifike.
https://app.notion.com/p/GT6-PROMPT-f31c91b622e44c13b8f3421f991ad417
Entre para a comunidade Simplifike
Receba novidades sobre inteligência artificial, ferramentas, tutoriais práticos e oportunidades diretamente no WhatsApp.
✓ Entrar no grupo gratuitamente Grupo gratuito. Você pode sair quando quiser.

