Meine Erfahrung mit dem erweiterten Sprachmodus von ChatGPT: Beispiellos natürlich
Entdecken Sie meine Erfahrungen mit dem verbesserten Sprachmodus von ChatGPT. Gespräche fühlen sich natürlicher und realistischer an, sodass Sie das Gefühl haben, mit einem echten Menschen zu sprechen.
Die wichtigsten Dinge, die Sie wissen müssen
- Mit GPT-Live können Sie gleichzeitig sprechen und zuhören, was Unterbrechungen ermöglicht und ein natürlicheres Gesprächserlebnis mit schnelleren Reaktionen gewährleistet.
- Es kann komplexe Aufgaben im Hintergrund erledigen und während des Sprechens Echtzeitübersetzungen liefern, wobei Hintergrundgeräusche ignoriert werden.
- Sie können den Grad der Sprachintelligenz von ChatGPT in drei Modi (sofort, mittel, hoch) anpassen, um Reaktionsgeschwindigkeit und Genauigkeit in Einklang zu bringen.
Das neueste Upgrade für ChatGPT, GPT-Live, wird aktuell für alle Nutzer ausgerollt. OpenAI beschreibt es als eine „neue Generation“ von Sprachmodellen für die Interaktion mit KI-gestützten Chatbots. Möglicherweise werden Sie dadurch dazu angeregt, mehr Zeit mit Chatten als mit Tippen zu verbringen und so die besten Funktionen von ChatGPT zu entdecken.

Die Spracheingabe in ChatGPT ist zwar nicht neu, stellte aber bisher nur eine relativ einfache Ergänzung zur Standard-Texteingabe und -ausgabe dar. Sie wurde als natürlichere Art der Interaktion mit KI beschrieben, doch GPT-Live verspricht, diese nahtlose Integration auf ein völlig neues Niveau zu heben.
Erstmals kann der Audiomodus im Hintergrund arbeiten und das Gespräch fortsetzen. Er bietet Ihnen außerdem zusätzliche Pausenmöglichkeiten und signalisiert mit Ausdrücken wie „Mmm“ oder „Ja“, dass er weiterhin zuhört.
Das Upgrade sollte jetzt (oder in Kürze) für Mobilgeräte und Webbrowser verfügbar sein. Kostenlose Nutzer erhalten Zugriff auf GPT-Live-1 mini, während Abonnenten kostenpflichtiger Tarife Zugriff auf das intelligentere GPT-Live-1-Modell erhalten.
Wie funktioniert GPT-Live?
OpenAIs erklärtes Ziel ist es, die Interaktion mit ChatGPT so intuitiv wie möglich zu gestalten, und GPT-Live kommt diesem Ziel immer näher. Ursprünglich benötigte die Sprachinteraktion mit KI ein separates Modell für die Spracherkennung, ein weiteres für die eigentliche Antwort auf die Anfrage und ein drittes für die Sprachausgabe.
Das vorherige Sprachmodell von ChatGPT integrierte all dies in ein einziges KI-Modell, war aber weiterhin rundenbasiert: Man spricht, der Chatbot antwortet, dann spricht man erneut. Mit GPT-Live kann ChatGPT gleichzeitig sprechen und zuhören. Man kann ihn bei Bedarf unterbrechen, und die Antworten erfolgen schneller und präziser.
Der neue Sprachmodus soll intelligenter zwischen einer kurzen Gesprächspause und dem tatsächlichen Abschluss einer Anfrage unterscheiden. Das System berechnet nun mehrmals pro Sekunde neu, ob gesprochen, weiter zugehört, pausiert, unterbrochen oder ein Tool aufgerufen werden soll.
Quelle: OpenAI
Ein weiterer Vorteil dieses Upgrades ist, dass selbst komplexe Aufgaben und tiefgründige Überlegungen im Hintergrund an die ChatGPT-Server gesendet werden können, während die Unterhaltung weiterläuft. Sie können ChatGPT auch bitten, die Übertragung zu pausieren oder zu verlangsamen. Die visuellen Antworten wurden ebenfalls verbessert, sodass Ihnen beispielsweise Pop-up-Karten für Orte, Wettervorhersagen und Sportergebnisse angezeigt werden.
Sie können GPT-Live jetzt auch bitten, Ihre Aussagen während des Sprechens in eine Fremdsprache zu übersetzen. Dank dieser neuen Funktionen hören Sie die Übersetzung in der Zielsprache sofort, ohne Pausen oder Unterbrechungen. Außerdem wurden Verbesserungen vorgenommen, um Hintergrundgeräusche (wie Verkehrslärm oder Gespräche in der Nähe) herauszufiltern.
GPT-Live-Erfahrung
Um in der mobilen App auf den Audiomodus zuzugreifen, tippen Sie auf das Schallwellensymbol rechts neben dem Eingabefeld. Der neue Modus sieht dem alten sehr ähnlich, aber mit diesem Update sollte oben auf dem Bildschirm das Wort „Live“ angezeigt werden (zumindest vorerst; Sie können darauf tippen, um zu den älteren Modellen zurückzukehren).
Der aktualisierte Sprachmodus klingt sofort realistischer und natürlicher. ChatGPT spricht abwechslungsreich und ausdrucksstark und gibt hilfreiche Hinweise wie „Ich schaue mal nach“, wenn es etwas sucht. Manchmal zögert es auch und zieht Wörter in die Länge.
Ich unterhielt mich mehrere Minuten lang mit GPT-Live über kommende Filme, aktuelle Fußballspiele und Schlagzeilen aus der Technologiebranche und erhielt respektvolle, prägnante und logische Antworten (der Audiomodus bleibt ein Zufluchtsort für diejenigen, die nicht für jede Antwort ellenlange Textwände sehen möchten).
Es stehen drei Stufen der „Intelligenz“ zur Auswahl. Quelle: OpenAI
Es gab einige wenige Momente, in denen das Gespräch ins Stocken geriet und abbrach, aber das geschah nur während etwa einer halben Stunde (und diese kleinen Fehler sollten sich mit der Zeit beheben lassen). Auch Unterbrechungen werden hervorragend gehandhabt: Die KI hält inne, um das Gesagte zur Kenntnis zu nehmen, und setzt dann ihren Gedankengang fort.
Sie können den Intelligenzgrad von ChatGPT im neuen Sprachmodus anpassen: Klicken Sie auf das Schiebereglersymbol (oben rechts) und anschließend auf „Intelligenz“ . Es stehen drei Modi zur Auswahl – Sofort , Mittel und Hoch – mit unterschiedlichen Abstufungen des Verhältnisses von Reaktionsfähigkeit, Detailgenauigkeit und Präzision.
Kommentarfunktion ist geschlossen.