Google Lyria 3.5: Vollständige Songs aus Text und Bildern
Das Musikmodell erzeugt strukturierte Stücke mit Gesang und Liedtexten – inklusive steuerbarer Dauer, Songform und Instrumentierung.

Komplette Songform
Lyria 3.5 erzeugt vollständige Stücke mit Strophen, Refrains und Bridges. Dauer, Dynamik und Instrumentierung lassen sich im Prompt den einzelnen Abschnitten zuordnen.
Bilder als Richtung
Ein Bild oder Moodboard kann die Atmosphäre vorgeben, während Text die musikalische Form präzisiert.
Audio plus Liedtext
Das Modell liefert 44,1-kHz-Stereo als MP3 und gibt den erzeugten Liedtext mit aus.
Google hat Lyria 3.5 als Preview veröffentlicht und verschiebt damit den Schwerpunkt seiner Musikgenerierung: Statt nur eine Klangidee oder einen kurzen musikalischen Ausschnitt auszugeben, soll das Modell vollständige Songs mit nachvollziehbarer Dramaturgie erzeugen. Strophen, Refrains und Bridges können bereits in der Eingabe benannt werden; neben dem Audio liefert das Modell auch Liedtexte.
Der Zugriff ist nicht auf eine einzelne Oberfläche beschränkt. Google stellt Lyria 3.5 in der Gemini-App, über die Gemini API und Google AI Studio sowie in Google Flow Music und Google Vids bereit. Für die Gemini-App nennt Google eine weltweite Verfügbarkeit im Web und auf Mobilgeräten. In der API trägt die Preview den Modellcode lyria-3.5.
Vom Klangentwurf zum vollständigen Song
Die entscheidende Neuerung ist die Verbindung aus längerer Form und präziserer Steuerung. Ein Prompt kann nicht nur Genre, Stimmung oder Instrumente beschreiben, sondern auch festlegen, wie sich ein Stück über mehrere Abschnitte entwickelt. Dadurch lässt sich etwa ein ruhiger Einstieg verlangen, der in einen breiteren Refrain übergeht und nach einer reduzierten Bridge mit einem letzten Höhepunkt endet.
Google beschreibt Lyria 3.5 als Modell für vollständige Songs, deren Generierung einige Minuten dauern kann. Die Ausgabe enthält 44,1-kHz-Stereo-Audio im MP3-Format sowie die erzeugten Liedtexte. Damit liegt ein direkt verwendbarer Entwurf vor, dessen musikalische Form und Text zusammengehören – nicht bloß eine isolierte Audiospur ohne sichtbare Gesangsgrundlage.
Auch natürliche Stimmen und musikalische Kohärenz über die gesamte Länge gehören zu den Schwerpunkten des Updates. Laut Google schneidet Lyria 3.5 gegenüber Lyria 2 bei Audiotreue und beim Befolgen komplexerer Anweisungen besser ab. Die zugrunde liegende Modellkarte bezeichnet es als latentes Diffusionsmodell, das Musik-Audio und Liedtexte aus Texteingaben erzeugt.
Ein Moodboard wird zur musikalischen Richtung
Neben Text akzeptiert Lyria 3.5 auch Bilder als Ausgangspunkt. Das eröffnet einen konkreten Einsatz für visuell entwickelte Projekte: Ein Standbild, eine Szenenillustration oder ein Moodboard kann die Atmosphäre vorgeben, während der ergänzende Text die musikalischen Entscheidungen präzisiert.
Für eine nächtliche Stadtszene könnte die Eingabe beispielsweise einen zurückgenommenen elektronischen Titel mit pulsierendem Bass, weiblichem Gesang und langsam wachsender Dichte verlangen. Das Bild trägt Farbe und Stimmung bei; der Text definiert Tempo, Besetzung, Stimme und Songform. So wird die visuelle Referenz nicht als starres Notenmaterial interpretiert, sondern als ästhetischer Kontext für den erzeugten Titel.
Diese Verbindung bietet sich besonders für frühe Videoentwürfe an. Eine Bildwelt und ihre Musik lassen sich aus derselben kreativen Richtung ableiten, bevor Schnitt und Länge endgültig feststehen. In Google Vids beziehungsweise Flow Music liegt der Nutzen nahe: Die musikalische Skizze kann direkt an eine visuelle Idee gekoppelt werden, ohne dass der Prompt auf eine allgemeine Angabe wie „cinematisch“ beschränkt bleibt.
Strukturmarkierungen geben dem Stück Form
Ein guter Lyria-Prompt beschreibt nicht nur, wie ein Song klingen soll, sondern wann etwas passieren soll. Google nennt Abschnittsmarkierungen wie Verse, Chorus und Bridge ausdrücklich als Mittel zur Struktursteuerung. Statt alle Wünsche in einen einzigen Stilabsatz zu packen, kann die Eingabe die musikalischen Rollen der einzelnen Teile benennen.
Ein belastbares Beispiel wäre: eine kurze instrumentale Einleitung mit Klavier und leiser Percussion; eine erste Strophe mit intimer Stimme; ein Refrain mit breiteren Harmonien und zusätzlichem Bass; eine reduzierte Bridge ohne Schlagzeug; anschließend ein letzter Refrain mit dichterem Arrangement. Eine gewünschte Gesamtdauer ergänzt die Formvorgabe.
Die Markierungen helfen vor allem dann, wenn sich die Abschnitte wirklich unterscheiden. „Verse“ und „Chorus“ allein sagen wenig über Dynamik oder Instrumentierung aus. Konkreter wird die Eingabe durch Angaben wie „Strophe sparsam und erzählerisch“ oder „Refrain mit mehrstimmigem Gesang und geöffnetem Schlagzeug“. Auf diese Weise steuert der Prompt sowohl die Gliederung als auch den hörbaren Kontrast innerhalb des Songs.
Gesang und Liedtext gemeinsam planen
Lyria 3.5 erzeugt auf Wunsch gesungene Musik und liefert den dazugehörigen Liedtext mit aus. Deshalb lohnt es sich, Thema, Perspektive und sprachliche Form bereits in der Eingabe festzulegen. Ein Prompt kann etwa eine Ich-Perspektive, kurze Refrainzeilen und bildhafte Strophen verlangen, anstatt nur das breite Thema eines Liedes zu nennen.
Auch die gewünschte Gesangsart sollte zur Instrumentierung passen. Begriffe wie zurückhaltend, klar, rau oder mehrstimmig beeinflussen eine andere Ebene als Genrebezeichnungen. Ein akustisches Arrangement mit naher, leiser Stimme verfolgt ein anderes Ziel als derselbe Text mit großem Chor und dichter Produktion. Die feinere Befolgung komplexer Anweisungen ist daher besonders nützlich, wenn Stimme, Textform und Arrangement gemeinsam beschrieben werden.
Für Instrumentalstücke lässt sich der Gesang ausdrücklich ausschließen. In der Gemini-App können Nutzer laut Google zwischen gesanglichen und instrumentalen Richtungen wählen und außerdem kurze oder längere Ergebnisse anfordern. Wer über die API arbeitet, formuliert diese Entscheidungen zusammen mit Dauer und Struktur in der Eingabe.
Was in einem Durchlauf entschieden werden muss
Die aktuelle Preview unterstützt einzelne Generierungsdurchläufe, aber kein mehrstufiges Überarbeiten eines vorhandenen Songs. Ein Ergebnis lässt sich dem Modell somit nicht Abschnitt für Abschnitt zurückgeben, um nur die Bridge auszutauschen oder den letzten Refrain gezielt umzuschreiben. Eine neue Variante entsteht durch eine weitere vollständige Generierung mit einem angepassten Prompt.
Das macht eine klare Priorisierung in der Eingabe wichtig. Zuerst sollten Zweck und Grundcharakter stehen, danach Dauer und Songstruktur, anschließend Instrumente, Gesang und Entwicklung. Widersprüchliche Wünsche – etwa ein durchgehend minimalistisches Arrangement und zugleich ein maximal dichter Refrain – brauchen eine zeitliche Zuordnung, damit das Modell erkennt, welcher Zustand für welchen Abschnitt gilt.
Praktisch bedeutet das: Wenn die erste Fassung zu früh ihren Höhepunkt erreicht, sollte der nächste Prompt die Dynamikkurve genauer beschreiben. Ist die Bridge dem Refrain zu ähnlich, helfen konkrete Unterschiede bei Rhythmus, Instrumentierung und Stimme. Die Korrektur findet also in der Beschreibung der nächsten vollständigen Variante statt, nicht als direkte Bearbeitung der bestehenden Audiodatei.
Drei Anwendungen, die jetzt greifbar werden
Für einen Videoentwurf kann ein Bild als Ausgangspunkt dienen, ergänzt um gewünschte Länge und Dramaturgie. Der Prompt beschreibt, an welcher Stelle ein ruhiger Einstieg in einen markanten Refrain übergeht. Dadurch entsteht ein vollständiger musikalischer Bogen, der sich besser als temporäre Filmmusik eignet als eine kurze, endlos wiederholte Passage.
Für einen Songentwurf kann die Eingabe bereits Strophen, Refrain und Bridge samt unterschiedlicher Instrumentierung festlegen. Entscheidend ist dabei nicht die Menge der Adjektive, sondern die Zuordnung: Welche Stimme singt in welchem Teil, welche Instrumente kommen hinzu, und wo nimmt die Energie wieder ab? Lyria 3.5 kann diese komplexeren Beziehungen laut Googles Vergleich besser befolgen als Lyria 2.
Für eine instrumentale Marken- oder Formatidee lässt sich eine wiedererkennbare Klangwelt beschreiben, ohne einen Gesangstext anzufordern. Tempo, Instrumentenfamilien, Dichte und gewünschte Dauer bilden dann die Leitplanken. Weil die Ausgabe als 44,1-kHz-Stereo-MP3 erfolgt, kann der Entwurf unmittelbar angehört, geteilt und gegen das visuelle Material bewertet werden.
Preview-Zugriff und Kosten
Über die Gemini API kostet eine vollständige Songgenerierung mit Lyria 3.5 laut offizieller Preistabelle 0,08 US-Dollar pro Anfrage. Ein kostenloses API-Kontingent steht für dieses Modell nicht zur Verfügung. Google gibt außerdem an, dass Inhalte aus dem kostenpflichtigen Tarif nicht zur Verbesserung seiner Produkte verwendet werden.
Die Abrechnung pro vollständiger Generierung ist bei Varianten relevant: Da bestehende Songs nicht mehrstufig bearbeitet werden können, löst jeder neue Versuch eine weitere Anfrage aus. Zehn vollständige Varianten entsprechen damit 0,80 US-Dollar. Das ist kein Qualitätsvergleich, macht aber den wirtschaftlichen Unterschied zwischen einem präzisen ersten Prompt und vielen unspezifischen Wiederholungen sichtbar.
Außerhalb der API verteilt Google das Modell über mehrere eigene Produkte. Die Gemini-App bietet den niedrigschwelligen Einstieg; Google AI Studio richtet sich an das Erproben von API-Eingaben. Flow Music und Google Vids binden die Musikgenerierung näher an audiovisuelle Anwendungen. Welche Oberfläche passt, hängt somit weniger von der Audioqualität als davon ab, ob ein einzelner Song ausprobiert, eine Eingabe technisch integriert oder Musik direkt mit Bildern verbunden werden soll.
Kennzeichnung und verantwortliche Verwendung
Sämtliche mit Lyria 3.5 erzeugten Ausgaben tragen nach Angaben von Google ein SynthID-Wasserzeichen. Diese technische Kennzeichnung begleitet das Audio unabhängig davon, ob die Generierung über Text oder ein Bild angestoßen wurde.
Die Modellkarte nennt außerdem mögliche problematische Inhalte sowie Verletzungen von Urheber-, Persönlichkeits- und Datenschutzrechten als relevante Einsatzfelder für Schutzmaßnahmen. Für die praktische Nutzung folgt daraus eine klare Grenze: Eigene Beschreibungen, freigegebene Bilder und originäre Songkonzepte sind geeigneter als Anforderungen, die eine reale Person oder geschütztes Material möglichst genau nachbilden sollen.
Lyria 3.5 ist damit vor allem ein Sprung bei der Form: Google verbindet längere, kohärentere Musik mit steuerbaren Abschnitten, Gesang, Liedtexten und visuellen Eingaben. Der größte Gewinn entsteht nicht durch einen immer längeren Stilprompt, sondern durch eine präzise musikalische Dramaturgie – mit klarer Dauer, unterscheidbaren Songteilen und einer beschriebenen Entwicklung vom ersten Takt bis zum Ende.
Quellen: Lyria-3.5-Modellbeschreibung, Leitfaden zur Musikgenerierung, Gemini-API-Preise, Google-Ankündigung zur Verfügbarkeit, Modellkarte von Google DeepMind
