Gemini creerà musica con AI: come funzionerà? 

Condividi:
Facebook
X
Telegram
Threads
WhatsApp

Il futuro di Gemini suonerà letteralmente. Un’analisi approfondita dell’APK versione 17.2.51.sa.arm64 dell’app Gemini per Android ha rivelato stringhe di codice che lasciano poco spazio all’immaginazione: Google sta preparando una funzionalità di generazione musicale integrata direttamente nell’assistente AI, portando tecnologie finora confinate all’API Gemini o all’app Pixel Recorder alla portata di centinaia di milioni di utenti. La scoperta, effettuata da Android Authority, rappresenta un salto strategico significativo nella guerra delle AI generative, dove la musica è diventata il nuovo campo di battaglia dopo immagini e video.

Cosa rivela il codice: “MUSIC_GENERATION_AS_TOOL”

Le evidenze sono chiare. Nel codice dell’APK compare una nuova funzionalità etichettata come “MUSIC_GENERATION_AS_TOOL” — esattamente ciò che il nome suggerisce: uno strumento per generare musica accessibile come tool nativo di Gemini, proprio come oggi l’assistente può generare immagini con Nano Banana o cercare informazioni sul web.

Ma c’è di più. Android Authority ha scoperto che Google sta riorganizzando la sezione “My Stuff” — lo spazio che raccoglie tutti i contenuti generati con Gemini — per includere una nuova categoria dedicata alla musica. Questo significa che le tracce create dall’AI verranno archiviate separatamente da immagini, video, documenti e codice, suggerendo che Google prevede un utilizzo significativo della funzione.

Le stringhe di codice contengono anche riferimenti a possibili restrizioni d’uso, probabilmente legate al tipo di account Gemini (gratuito, Advanced, Ultra). Non è ancora chiaro se queste limitazioni riguarderanno il numero di brani generabili, la durata massima, o l’accesso a funzionalità avanzate — ma il pattern ricalca quello già visto con altre feature premium di Gemini.

La tecnologia esiste già: Lyria e Pixel Recorder

La vera notizia non è che Google può fare generazione musicale AI — è che finora l’ha tenuta confinata in ambienti ristretti. La tecnologia si chiama Lyria, ed è già disponibile tramite l’API Gemini da mesi.

Lyria è un modello di generazione musicale strumentale che lavora in real-time. Gli sviluppatori possono usarlo per costruire applicazioni in cui gli utenti creano, dirigono ed eseguono musica interattivamente. Il modello accetta prompt testuali ponderati (descrizioni di genere, strumento, mood, caratteristiche), e genera audio con controllo granulare su parametri come BPM (60-200), densità note, scala musicale, e persino opzioni per silenziare bassi o batteria.

La versione RealTime usa connessioni WebSocket bidirezionali a bassa latenza, permettendo modifiche in tempo reale mentre la musica viene generata. È sofisticato, potente, ma relegato a sviluppatori con competenze tecniche. Gemini lo renderà mainstream.

Google ha anche già testato la generazione musicale consumer con Pixel Recorder, l’app esclusiva dei telefoni Pixel. Introdotta con il Pixel 10 ad agosto 2025 e poi estesa ai Pixel 9 a dicembre 2025, la funzione “Create music” permette di registrare una melodia cantata o canticchiata (minimo 30 secondi), selezionare un “vibe” (Chill Beats, Dance Party, Romantic, Rainy Day Blues), e l’AI genera un accompagnamento strumentale sincronizzato con il ritmo e l’armonia della registrazione originale.

I risultati, secondo chi l’ha provato, sono sorprendentemente solidi per quanto riguarda tempo e tonalità, anche se ancora generici dal punto di vista creativo. Ma il punto è un altro: Google ha dimostrato che può portare generazione musicale AI in un’interfaccia semplice, consumer-friendly, accessibile con pochi tap. Ora quella stessa filosofia sta per arrivare in Gemini.

Perché Google entra nel mercato AI music proprio ora

Il tempismo non è casuale. Il mercato della generazione musicale AI ha raggiunto una massa critica nel 2025. Suno, il leader indiscusso con il suo modello v4.5, genera oltre 100 milioni di dollari di ricavi annuali ricorrenti e ha una valutazione superiore ai 2 miliardi di dollari. Udio, fondato da ex-ricercatori Spotify, si è ritagliato una nicchia tra produttori professionali grazie a funzioni avanzate come download di stem separati, inpainting (rigenerazione di sezioni specifiche), e remix che cambiano genere mantenendo la melodia.

OpenAI, secondo The Information, sta sviluppando un proprio strumento musicale che potrebbe integrarsi con ChatGPT e Sora. Il progetto coinvolge studenti della prestigiosa Juilliard School per annotare spartiti musicali, creando dataset di addestramento di qualità superiore — una strategia che ricalca l’approccio OpenAI a ogni nuova modalità generativa.

E poi c’è il contesto legale, che è radicalmente cambiato. Nel 2024, Universal Music Group, Warner Music e Sony Music avevano fatto causa sia a Suno che a Udio per presunta violazione di copyright, accusandoli di aver addestrato i modelli AI su musica protetta senza autorizzazione. Fine 2025, tutti gli accordi legali sono stati raggiunti: le major non sono più antagoniste, ma partner con accordi di licenza e partecipazioni azionarie nelle startup AI music.

Questo ha legittimato il settore. Se prima c’era incertezza legale, ora c’è un framework — e Google, con la sua capacità di negoziare licenze su scala globale e i suoi precedenti accordi con l’industria musicale (YouTube Music, Content ID), è posizionata meglio di chiunque altro per navigare questo nuovo panorama.

Come potrebbe funzionare in Gemini

Basandoci su ciò che Google ha già costruito, possiamo immaginare l’esperienza utente. Aprite Gemini, digitate un prompt tipo “crea una traccia lofi chill per studiare, 90 BPM, con pianoforte e leggera batteria” — e l’AI genera una composizione strumentale di 2-3 minuti. Oppure caricate una registrazione vocale e chiedete “aggiungi un accompagnamento chitarra acustica stile folk”.

La musica generata finirebbe automaticamente in “My Stuff” nella categoria musica, da dove potreste scaricarla, condividerla, o magari usarla come colonna sonora per video creati con altri strumenti AI. L’integrazione con l’ecosistema Google potrebbe permettere di inserire direttamente le tracce in progetti YouTube, Google Foto, o persino come suoneria personalizzata.

Le restrizioni menzionate nel codice potrebbero funzionare così: utenti gratuiti generano 5 brani al mese di massimo 1 minuto; Gemini Advanced illimitati fino a 3 minuti; Gemini Ultra con controlli avanzati su strumenti, struttura, e magari anche generazione vocale (tecnologia che Lyria già supporta in modalità sperimentale).

Il problema che nessuno ha ancora risolto

C’è però un elefante nella stanza che vale per Gemini quanto per Suno, Udio, e OpenAI: la qualità della musica AI generativa è ancora lontana da quella umana per utilizzi professionali. Va benissimo per background musicale, contenuti social, progetti personali. Ma se avete bisogno di una colonna sonora emotivamente risonante per un cortometraggio, o di un brano con una vera identità artistica, l’AI nel 2026 non ci arriva ancora.

Il rischio vero è la saturazione. Deezer ha riportato che a settembre 2025 il 28% dei brani caricati sulla piattaforma era completamente generato da AI — in crescita dal 18% di aprile. Spotify è già invaso da “artisti AI” fittizi con milioni di stream. Se Gemini porta la generazione musicale a centinaia di milioni di utenti, potremmo vedere un’esplosione di contenuti musicali generici che diluisce ulteriormente il valore percepito della musica online.

Ma Google probabilmente scommette su un utilizzo diverso: non sostituire musicisti, ma democratizzare la creazione musicale per chi non ha competenze. Il creator YouTube che ha bisogno di un jingle. Lo sviluppatore di giochi indie che cerca musica di sottofondo. Il genitore che vuole creare una canzoncina personalizzata per il compleanno del figlio. Casi d’uso dove “abbastanza buono” è più che sufficiente, e dove l’alternativa sarebbe pagare licenze musicali costose o usare tracce royalty-free sentite migliaia di volte.

La generazione musicale in Gemini non è ancora ufficiale — è codice work-in-progress che potrebbe cambiare o non vedere mai la luce pubblica. Ma le evidenze sono troppo concrete per essere ignorate. E se Google mantiene il pattern di sviluppo visto con altre feature, potremmo vedere un annuncio al prossimo Google I/O (maggio 2026), seguito da un rollout graduale nei mesi successivi.

La musica, dopotutto, è l’ultimo tassello che manca alle AI multimodali per essere davvero complete. Possono vedere, parlare, scrivere, creare immagini e video. Ora impareranno a suonare.


Fonti:

Per rimanere aggiornato sulle novità e sulle offerte del mondo della tecnologia, seguici su Telegram e Whatsapp

Articoli correlati

Disney+ ha inviato agli abbonati italiani una mail sulle nuove Condizioni generali. Entrano in vigore trenta giorni dopo l’avviso. Non...

Matteo Del Fante ha detto la frase che chiude la parte di Borsa e apre quella da organigramma. Al TG...

Oggi, lunedì 14 settembre, Apple apre il rubinetto di iOS 27, iPadOS 27, watchOS 27, tvOS 27, visionOS 27 e...

WhatsApp sta allargando alle chiamate quello che ha già fatto con le chat da ospite: far entrare chi non ha...

Samsung Display sta per dare alla serie Galaxy S il primo cambio serio di materiale OLED in tre anni. Secondo...

Apple Reference Image, in italiano Immagine di riferimento, è la risposta di Cupertino a una domanda che i fotografi si...