Gemini durchsucht lange Videos jetzt agentisch
Gemini 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite navigieren selbstständig durch Videozeitleisten und holen Transkripte, Frames oder Audio nur bei Bedarf.

Gemini Video sucht selbst. Google hat das agentische Videoverständnis für Gemini 3.7 Flash, Gemini 3.6 Flash und Gemini 3.5 Flash-Lite veröffentlicht. Die Modelle können dynamisch durch eine Videozeitleiste navigieren und während der Bearbeitung Transkripte, einzelne Frames oder die Audiospur anfordern. Laut dem Changelog von Google benötigt dieser Ansatz bei langen Inhalten bis zu 88 Prozent weniger Tokens als eine statische Verarbeitung.
Damit verschiebt sich die Arbeit von der vollständigen Vorverarbeitung zur gezielten Suche im Material. Bei einem langen Interview muss nicht jede Minute mit derselben Detailtiefe berücksichtigt werden. Gemini kann zunächst relevante Passagen bestimmen und anschließend genau dort zusätzliche Hinweise aus Sprache, Bild oder Ton heranziehen.
Vom kompletten Video zur gezielten Ermittlung
Bei einer statischen Analyse wird das benötigte Material vorab ausgewählt und gemeinsam an das Modell übergeben. Dabei muss früh entschieden werden: Reicht ein Transkript, werden zusätzlich Frames benötigt oder muss auch die Audiospur berücksichtigt werden? Bei langen Videos entsteht dadurch viel zu verarbeitendes Material, obwohl eine konkrete Frage häufig nur wenige Stellen betrifft.
Das agentische Verfahren kehrt diese Reihenfolge um. Am Anfang steht die Aufgabe, etwa: „Finde alle Stellen, an denen die Sprecherin den neuen Freigabeprozess erklärt.“ Das Modell navigiert anschließend entlang der Zeitleiste. Für sprachliche Aussagen kann es das Transkript heranziehen, für gezeigte Arbeitsschritte einzelne Bilder und für akustische Ereignisse die Tonspur. Diese Zugriffe erfolgen nach Bedarf statt als pauschales Paket.
Der entscheidende Baustein ist die Auswahlstrategie. Videoverständnis bedeutet hier nicht nur, mehrere Medienformen zu verarbeiten. Das Modell entscheidet während der Suche, welcher Ausschnitt und welche Spur zur Beantwortung beitragen. Gerade bei langen Aufzeichnungen reduziert das irrelevantes Material und macht präzisere Ermittlungsaufträge praktikabler.
Ein Interview nach Aussagen und Belegen durchsuchen
Ein konkreter Einsatz ist die Auswertung eines längeren Interviews. Gesucht werden beispielsweise alle Passagen, in denen eine Person über Einführung, Preis oder praktische Nutzung eines Produkts spricht. Ein geeigneter Auftrag benennt das Suchziel, verlangt Zeitmarken und fordert für jeden Treffer eine knappe Begründung.
Eine mögliche Formulierung lautet: „Untersuche das Video auf Aussagen zur Einführung des Produkts. Gib für jeden relevanten Abschnitt die Zeitmarke, eine sachliche Zusammenfassung und den erkennbaren Beleg an. Nutze Bildinformationen nur, wenn eine gezeigte Oberfläche oder Demonstration die Aussage ergänzt.“ Die Trennung zwischen Suchziel und Ergebnisstruktur hält die Antwort näher an den tatsächlich relevanten Passagen.
Das Transkript ist dafür der naheliegende erste Zugriff. Sobald eine gefundene Aussage auf etwas Sichtbares verweist – etwa „hier oben im Menü“ –, werden Frames rund um diese Passage wichtig. Die Audiospur kann relevant werden, wenn nicht nur Worte, sondern ein akustisches Ereignis gesucht wird. Gemini kann diese Quellen innerhalb derselben Aufgabe verbinden, ohne sämtliche Spuren vorsorglich in voller Länge heranzuziehen.
Das Ergebnis eignet sich als Recherchegrundlage, Kapitelübersicht oder Schnittliste. Zeitmarken verbinden die Modellantwort mit dem Originalmaterial und ermöglichen den direkten Sprung zu jeder ausgewählten Stelle.
Tutorials werden zu durchsuchbaren Arbeitsschritten
Bei Bildschirmaufnahmen und Tutorials reicht ein Transkript häufig nicht aus. Eine gesprochene Anweisung wie „Aktiviere diese Option“ enthält den Namen der Option womöglich gar nicht; er steht nur in der gezeigten Oberfläche. Genau hier bietet die bedarfsgesteuerte Kombination aus Sprache und Frames einen praktischen Vorteil.
Der Auftrag kann auf ein konkretes Resultat zielen: „Erstelle aus dem Tutorial eine Anleitung. Ermittle für jeden Arbeitsschritt die passende Zeitmarke, den sichtbaren Menüpunkt und die ausgeführte Aktion. Fasse Wiederholungen zusammen.“ Gemini kann zunächst über das Transkript nach handlungsorientierten Passagen suchen und anschließend an den betreffenden Zeitpunkten Frames abrufen, um sichtbare Elemente in die Beschreibung einzubeziehen.
Daraus entsteht eine strukturierte Rekonstruktion des gezeigten Ablaufs. Für interne Schulungen lässt sich eine lange Aufnahme in nachvollziehbare Schritte überführen. In der redaktionellen Arbeit können relevante Demonstrationen schneller lokalisiert werden. Bei der Aktualisierung einer Anleitung lassen sich jene Szenen finden, in denen eine bestimmte Oberfläche tatsächlich vorkommt.
Eine enge Aufgabenformulierung gibt der Navigation die nötige Richtung. „Analysiere dieses Video“ lässt offen, ob Inhalt, Dramaturgie, sichtbare Handlung oder Ton entscheidend sind. Zielbegriffe, gewünschte Granularität und eine feste Ergebnisform machen daraus eine klar begrenzte Suche.
So entsteht eine Fundstellenliste
Der Ablauf beginnt mit dem Video und einer präzisen Frage. Die Funktion ist laut Google für Gemini 3.7 Flash, Gemini 3.6 Flash und Gemini 3.5 Flash-Lite verfügbar. Der Auftrag sollte festlegen, wonach Gemini sucht, welche Bestandteile des Videos als Belege dienen und wie die Treffer aufgebaut sein sollen.
Für eine Meeting-Aufzeichnung könnte er lauten: „Finde beschlossene Aufgaben. Gib pro Aufgabe die Zeitmarke, die zuständige Person und den erkennbaren Beschluss sinngemäß wieder. Trenne sichere Beschlüsse von Vorschlägen.“ Für eine Produktdemo passt eine andere Struktur: „Liste alle gezeigten Funktionen mit Zeitmarke, sichtbarer Aktion und genanntem Nutzen.“ Gemini erkundet daraufhin die Zeitleiste und zieht an passenden Fundstellen Transkript, Bild oder Ton hinzu.
Die Antwort lässt sich auf überprüfbare Einheiten begrenzen: Zeitmarke, kurze Aussage, verwendeter Belegtyp und knappe Einordnung. Eine konstante Feldstruktur erleichtert es, Treffer zu sortieren, zu filtern oder in eine Schnittplanung zu übernehmen. Die ausgewählten Zeitbereiche führen anschließend direkt zurück zu den jeweiligen Passagen im Originalvideo.
Drei Modelle erhalten denselben neuen Baustein
Google nennt drei unterstützte Modelle: Gemini 3.7 Flash, Gemini 3.6 Flash und Gemini 3.5 Flash-Lite. Für alle drei besteht die Neuerung darin, dass sie innerhalb langer Videos selbst nach den für eine Aufgabe relevanten Stellen suchen können.
Dabei werden Transkripte, Frames und Audio nicht automatisch über die gesamte Laufzeit mit gleicher Intensität berücksichtigt. Gemini fordert die jeweils passende Informationsart situativ an. Eine gesprochene Erklärung kann über das Transkript gefunden, eine sichtbare Handlung mit Frames ergänzt und ein relevantes Geräusch über die Tonspur erfasst werden.
Die Auswahl des Modells ändert damit nicht den redaktionellen Kern des Auftrags: Das Suchziel muss konkret, der zulässige Beleg klar und das gewünschte Ergebnis eindeutig formuliert sein. Je enger diese drei Punkte gefasst sind, desto gezielter kann Gemini durch das Material navigieren.
Wie Googles Angabe von bis zu 88 Prozent einzuordnen ist
Der Changelog von Google nennt für lange Inhalte eine Token-Ersparnis von bis zu 88 Prozent gegenüber statischer Verarbeitung. Es handelt sich um einen Maximalwert: Wie groß die Einsparung ausfällt, hängt davon ab, wie viel Material für die konkrete Antwort tatsächlich benötigt wird.
Bei einer eng umrissenen Frage in einer mehrstündigen Aufnahme ist das Potenzial besonders nachvollziehbar. Wenn nur wenige Minuten relevant sind, muss die Analyse nicht jede Passage gleich behandeln. Soll dagegen jeder Moment Szene für Szene beschrieben werden, benötigt die Aufgabe einen wesentlich größeren Teil des Videos; der Vorteil der selektiven Navigation fällt dann entsprechend kleiner aus.
Die Technik belohnt präzise Aufträge. Suchbegriffe allein definieren noch nicht, was als Treffer gilt. Besser ist die Kombination aus Gegenstand, Entscheidungskriterium und gewünschtem Beleg: „Finde Stellen, an denen eine Funktion sichtbar demonstriert wird; nenne nur Treffer, bei denen Handlung und gesprochene Erklärung zusammenpassen.“ Damit erhält Gemini eine klare Regel für die Auswahl entlang der Zeitleiste.
Drei Aufgabenprofile passen besonders gut
Erstens eignet sich die Funktion für punktuelle Recherche in umfangreichem Archivmaterial. Gesucht werden Namen, Aussagen, gezeigte Gegenstände oder definierte Ereignisse. Das Ergebnis ist eine Liste relevanter Passagen statt einer allgemeinen Zusammenfassung des gesamten Videos.
Zweitens bietet sie sich für die Umwandlung von Demonstrationen in strukturierte Inhalte an. Ein Tutorial kann zu einer Schrittfolge werden, eine Produktvorführung zu einer Funktionsliste und eine Schulungsaufzeichnung zu einem Nachschlagewerk mit Zeitmarken. Frames ergänzen Informationen, die im gesprochenen Text fehlen.
Drittens unterstützt sie die Vorbereitung redaktioneller Schnitte. Ein Auftrag kann Szenen nach inhaltlichen Kriterien finden, passende Zeitbereiche nennen und ausweisen, ob der Beleg aus Sprache, Bild oder Ton stammt. Die eigentliche Bearbeitung bleibt ein separater Schritt, doch die Suche durch langes Rohmaterial wird enger geführt.
Für eine lückenlose Beschreibung jedes Moments ist der Selektionsvorteil geringer. Die Stärke liegt dort, wo eine konkrete Frage nur einen Teil des Materials betrifft und unterschiedliche Spuren an den relevanten Stellen zusammengeführt werden müssen.
Der eigentliche Fortschritt ist die Navigation
Googles Veröffentlichung erweitert Videoverständnis um eine aktive Recherchebewegung: Das Modell erhält nicht nur vorbereitete Ausschnitte, sondern sucht entlang der Zeitleiste nach dem Material, das eine Aufgabe beantwortet. Transkript, Frames und Audiospur werden zu Werkzeugen, die Gemini situativ anfordert.
In der Praxis lassen sich lange Videos dadurch mit konkreten Ermittlungsaufträgen bearbeiten. Gute Prompts nennen das gesuchte Ereignis, verlangen Zeitmarken, definieren zulässige Belege und geben eine feste Ergebnisstruktur vor. So entstehen überprüfbare Fundstellen für Interviews, Tutorials, Meetings oder Produktdemonstrationen.
Die Veröffentlichung ist im Changelog von Google dokumentiert. Praktische Beispiele für Gemini bündelt Google zusätzlich im Gemini Cookbook.