La barriera tra immaginazione e contenuto video si assottiglia ulteriormente. YouTube ha appena integrato nei suoi Shorts una tecnologia che permette a chiunque di creare video generati dall’intelligenza artificiale utilizzando la propria foto, uno sfondo e un oggetto a scelta. Si chiama “Ingredients to Video”, si basa sul modello Veo 3.1 di Google DeepMind, ed è disponibile da questa settimana anche per i creator italiani.
Non servono competenze di editing né software costosi: caricate fino a tre immagini — diciamo il vostro volto, una location e magari un oggetto scenico — scrivete un prompt testuale che descrive l’azione desiderata, e l’AI assembla il tutto in un clip verticale di pochi secondi, completo di audio generato. Il risultato? Video pronti per essere pubblicati direttamente su YouTube Shorts, TikTok o Instagram Reels.
Cosa cambia con Veo 3.1 e la modalità verticale nativa
Fino a pochi mesi fa, i modelli AI per la generazione video producevano contenuti quasi sempre in formato orizzontale, costringendo i creator a ritagliare e adattare manualmente i clip per i formati verticali dominanti sui social. Con Veo 3.1, Google ha introdotto il supporto nativo al formato 9:16, quello standard degli smartphone. Questo significa che i video nascono già ottimizzati per YouTube Shorts, senza perdite di qualità o necessità di crop.
La funzione “Ingredients to Video” garantisce anche una coerenza visiva che le precedenti versioni facevano fatica a mantenere. Se il vostro personaggio deve comparire in più scene, i tratti somatici restano identici. Lo stesso vale per oggetti e ambientazioni: un tavolo resta quel tavolo, una giacca mantiene colore e texture. Questo livello di continuità narrativa apre possibilità concrete per raccontare storie brevi senza che l’AI “dimentichi” chi o cosa ha generato pochi fotogrammi prima.
Come si usa Ingredients to Video su YouTube Shorts
L’accesso è diretto dall’app YouTube Create o dall’interfaccia di creazione degli Shorts. Toccate il pulsante “Crea”, poi l’icona a forma di stellina nell’angolo superiore destro per trovare gli strumenti AI più recenti, tra cui Veo 3. A quel punto selezionate “Create Video” nella galleria media e caricate le vostre immagini di riferimento — massimo tre.
Il prompt testuale è fondamentale: più siete specifici, migliore sarà il risultato. Non basta scrivere “una persona cammina”. Funziona meglio qualcosa come “un primo piano con camera a mano di una persona che cammina in una strada cittadina al tramonto, con rumori di traffico in sottofondo e luce dorata laterale”. L’AI di Veo 3.1 interpreta movimenti di camera, indicazioni sulla luce, atmosfera emotiva e persino gli elementi sonori che volete sentire.
La generazione richiede pochi minuti. Una volta pronto, il video è visualizzabile in 480p per gli Shorts (sufficiente per la maggior parte degli utilizzi social), ma chi lavora con strumenti professionali come Flow, Gemini API o Vertex AI può ottenere output fino al 4K con upscaling avanzato.
Audio generato dall’AI e trasparenza dei contenuti
Uno degli aspetti più sottovalutati di questa tecnologia è l’audio nativo. Non si tratta solo di musica di sottofondo: Veo 3.1 può generare dialoghi sincronizzati con il labiale, effetti sonori ambientali e atmosfere sonore coerenti con la scena descritta nel prompt. Se chiedete “passi su marmo con eco in una hall silenziosa”, l’AI cercherà di produrre esattamente quell’effetto acustico.
Google ha implementato il watermark digitale SynthID su tutti i video generati, una firma invisibile all’occhio umano ma rilevabile dai sistemi di verifica. Questo significa che, caricando un video nell’app Gemini, è possibile scoprire se è stato prodotto con l’AI di Google. Una scelta orientata alla trasparenza che risponde alle crescenti preoccupazioni sull’autenticità dei contenuti online.
Disponibilità in Italia e limiti attuali
La funzione è accessibile in Italia sia tramite YouTube Shorts che attraverso l’app YouTube Create. È sufficiente avere la lingua del dispositivo impostata su inglese per utilizzare gli strumenti AI più recenti di YouTube, almeno fino a quando Google non estenderà il supporto linguistico completo.
Ci sono restrizioni importanti da considerare. I filtri di sicurezza bloccano la generazione di contenuti violenti, sessualmente espliciti o che rappresentano minori. Anche i volti di celebrità sono generalmente vietati, a meno che non si disponga di autorizzazioni specifiche. Questo rende Ingredients to Video uno strumento pensato soprattutto per la creatività personale, i contenuti branded con autorizzazioni esplicite e le campagne pubblicitarie controllate.
La risoluzione base di 480p per gli Shorts può sembrare limitante, ma va contestualizzata: la maggior parte degli utenti consuma questi video su schermi da 6 pollici, dove la differenza con il Full HD è impercettibile. Per produzioni più ambiziose, la versione enterprise offre output in 1080p e 4K.
Il contesto più ampio: YouTube e la corsa all’AI generativa
Questo aggiornamento si inserisce in una strategia più vasta presentata da YouTube durante l’evento “Made on YouTube” di settembre 2025, dove la piattaforma ha svelato una serie di funzioni AI: dall’editing automatico con “Edit with AI” alla trasformazione di dialoghi in brani musicali con “Speech to Song”, fino al rilevamento non autorizzato della propria immagine con strumenti di likeness detection.
YouTube sta scommettendo sull’idea che l’AI non debba sostituire i creator, ma amplificare le loro possibilità creative. Ingredients to Video rappresenta un equilibrio interessante: democratizza la produzione video permettendo a chiunque di sperimentare con contenuti visivi sofisticati, ma lascia il controllo creativo nelle mani dell’utente. Non è un generatore automatico di spam — richiede pensiero, pianificazione e un minimo di sensibilità narrativa per ottenere risultati validi.
Resta da vedere come questa tecnologia evolverà nei prossimi mesi e quale impatto avrà sulla qualità media dei contenuti su Shorts. Una cosa è certa: la linea tra “creator con smartphone” e “studio di produzione” continua a sfumare, un fotogramma alla volta.
Fonti: