Adobe Firefly im Test: Taugen die drei neuen KI-gestützten Audio-Tools etwas?

Wir haben die drei neuen KI-gestützten Audio-Tools von Adobe Firefly getestet. Erfahren Sie, wie effektiv sie sind und ob sich ein Einsatz für Ihre Arbeit lohnt.

Die wichtigsten Dinge, die Sie wissen müssen

  • Generate Music ist der „wahre Gewinner“ unter den Tools. Es erzeugt zunächst akzeptable Tracks, die sich dramatisch verbessern, wenn man präzise Textbefehle verwendet, die Stimmung, Stil, Zweck und Energieniveau definieren.
  • Das Tool „Soundeffekte generieren“ ist sehr nützlich, erfordert präzise manuelle Textbefehle und ermöglicht das Hinzufügen mehrerer Audiospuren mit Kontrolle über deren Position und Lautstärke entlang einer Zeitleiste.
  • Generate Speech 45 bietet Sprechern Pausensteuerungsoptionen, was für Vermarkter und Content-Ersteller nützlich ist, um die tägliche Videoproduktion zu beschleunigen, ersetzt aber keine professionelle Sprachausgabe.

  • Adobe bringt drei neue Audio-Tools auf den Markt Mit künstlicher Intelligenz Innerhalb von Firefly
  • Kreative können jetzt die Funktionen „Musik generieren“, „Sprache generieren“ und „Soundeffekte generieren“ nutzen.
  • Ich habe es getestet, um zu sehen, wie es bei der Videoerstellung funktioniert.

Nach einer Beta-Testphase hat Adobe Firefly nun drei neue KI-gestützte Audio-Tools veröffentlicht, die „Sound in Studioqualität“ versprechen und allen Kreativen zur Verfügung stehen. Ich habe jedes einzelne getestet, um zu sehen, ob die Ergebnisse den Erwartungen gerecht werden – und im Großen und Ganzen taten sie das, abgesehen von einigen kleineren Problemen.

Musik generieren, Soundeffekte generieren und Sprache generieren sind die neuesten Audiofunktionen, die auf Adobes browserbasierter KI-Plattform verfügbar sind (ihre Funktionen sind aus ihren Namen selbsterklärend).

Aus meiner Erfahrung mit allen drei Tools sticht Generate Music besonders hervor; es ist weitaus besser als erwartet, und ich bin überzeugt, dass Marketer und Kreative enorm davon profitieren werden. Sie können es selbst ausprobieren, indem Sie hier klicken.

Und was gibt es Neues?

Drei KI-Tools stehen nun allen zur Verfügung. Ihre Funktionen sind weitgehend selbsterklärend, aber hier ist, was Sie wissen müssen:

  • Musik generieren Es ermöglicht Ihnen, lizenzierte Musiktitel zu erstellen, die zur Länge und Stimmung Ihrer Videos passen.
  • Sprache generieren Geschriebene Texte werden in Sprachkommentare umgewandelt.
  • Soundeffekte erzeugen Es erzeugt – wie Sie schon vermutet haben – Soundeffekte, die zur Bewegung und zum Timing des Videos passen.

Aber ist es wirklich so gut?

Ich habe bereits über meine Skepsis gegenüber künstlicher Intelligenz im Allgemeinen und meine Bedenken hinsichtlich ihres Einsatzes in kreativen Werken geschrieben. Sie ist lediglich eine Simulation von Kunst.

Adobes Tools beeindruckten jedoch selbst die größten KI-Skeptiker in meinem Team – insbesondere Funktionen wie Generative Extend in der Videobearbeitungssoftware. Und da ich ein aufgeschlossener Mensch bin, beschloss ich, diese Tools selbst auszuprobieren und mir ein genaues Bild von ihren Fähigkeiten zu machen.

Der Fokus liegt hier, zumindest vorläufig, auf der Beschleunigung des kreativen Workflows sowohl für Marketingfachleute als auch für Content-Ersteller .

Musikproduktion mit künstlicher Intelligenz

Adobe Firefly nutzt drei neue KI-gestützte Audio-Tools zur Erzeugung von Musik, Sprache und Soundeffekten.

Ich habe zunächst das Tool „Musik generieren“ verwendet . Dort kann man frei Textbefehle eingeben oder einen Videoclip hochladen, und die KI versucht, die gewünschte Musikrichtung zu erraten. Ich habe einen kurzen, 27 Sekunden langen Clip verwendet, den ich für meinen Test des reMarkable Paper Pure aufgenommen hatte (da er sich noch in meinem Download-Ordner befand).

Darauf aufbauend schlug Firefly einen Skriptbefehl für „einen ruhigen, tiefen, atmosphärischen elektronischen Song für eine Produktpräsentation“ vor.

Ich drückte auf den Generieren-Button, und innerhalb weniger Sekunden – die Geschwindigkeit war wirklich erstaunlich – wurden mir vier Tracks zur Auswahl präsentiert, alle unterschiedlich, aber mit der gleichen Stimmung. Sie waren … akzeptabel. Etwas generisch, aber für den Notfall oder um ein Projekt schnell fertigzustellen, könnten sie ihren Zweck erfüllen. (Mehr zum Einfluss von KI auf die Musikindustrie finden Sie in unserem Artikel darüber, dass Apple Music von Künstlern verlangt, KI-Musik zu kennzeichnen .)

Ich beschloss, dem Skriptbefehl weitere Begriffe wie „Jazz“ und „cinematic“ für die Verwendung in „Vlog“ und „Trailer“ hinzuzufügen. Außerdem änderte ich die Energieeinstellung von „niedrig“ auf „mittel“. Die Ergebnisse waren deutlich besser.

Wie bei allen KI-Tools gilt: Je präziser die Textbefehle, desto besser das Ergebnis. Sie können außerdem Atmosphäre, Stil und Zweck selbst beschreiben, falls Sie eine konkrete Vorstellung haben.

Hier können Sie Musik und Videos oder auch nur Musik herunterladen.

Erstellung KI-generierter Sprachaufnahmen

Adobe Firefly nutzt drei neue KI-gestützte Audio-Tools zur Erzeugung von Musik, Sprache und Soundeffekten.

Als nächstes kam ich zum Tool „Sprache generieren“ . Zuerst wählte ich über die Seitenleiste das zu verwendende KI-Modell aus; zum Zeitpunkt des Schreibens gab es das kommerziell sichere Firefly-Modell von Adobe und das Partnermodell ElevenLabs Multilingual V2.

Dann wählte ich einen Sprecher aus einer Liste von 45 Optionen aus, die jeweils unterschiedlich als männlich, weiblich, nicht-binär, jung, mittelalt, älter usw. beschrieben wurden.

Schließlich habe ich meinen Text in das Textfeld eingefügt; Firefly erkennt die verwendete Sprache automatisch, aber Sie können sie auch selbst auswählen. Ich habe das Gedicht „Ozymandias“ verwendet (mit meiner aufrichtigen Entschuldigung an Shelley).

Was mir hier besonders gut gefiel, war, dass man, sobald man den Text eingegeben hat, optional weiteren Text hinzufügen oder die KI anweisen kann, an bestimmten Stellen anzuhalten.

Um die Audioaufnahme tatsächlich vorhören zu können, musste ich den gesamten Clip auswählen und das Kontextmenü verwenden; dort kann man auch die Aussprache korrigieren und den Tonfall anpassen.

Bei all dem Gerede über die Beschleunigung von Arbeitsabläufen erscheint mir das ein Fehler zu sein. Es bräuchte lediglich einen Startknopf am unteren Bildschirmrand.

Ich musste die Pausenintervalle anpassen, um dem Text mehr Raum zu geben. Nachdem ich sie eingestellt hatte, konnte ich die Zeitabstände durch Klicken auf die Pausetaste im Vorschaubildschirm ändern. Aus irgendeinem Grund war es das Wort „Land“, das die KI verwirrte; sie sprach es „ lan “ aus.

Erstellung KI-gestützter Soundeffekte (SFX)

Adobe Firefly nutzt drei neue KI-gestützte Audio-Tools zur Erzeugung von Musik, Sprache und Soundeffekten.

Für diesen Test verwendete ich erneut ein Video, das ich für meinen reMarkable-Testbericht aufgenommen hatte – diesmal ein 12-sekündiger Clip, in dem ich das reMarkable 2 und das Paper Pure vergleiche.

Dieser Prozess ist deutlich komplexer, das heißt, die KI kann die möglichen Soundeffekte nicht erraten. Ich musste meine Wünsche manuell beschreiben. Anschließend klickte ich auf „Eingabeaufforderung erweitern“, wodurch weitere Beschreibungen hinzugefügt wurden.

Und so erhielten wir schließlich eine „gleitende Pfeife, die sanft abklingt und ein leises metallisches Klingeln von sich gibt“. Ein Klick auf „Generieren“ erzeugte schnell vier verschiedene, ohrenbetäubende Varianten. Ich werde Ihnen diese Ergebnisse nicht zeigen. Das wäre niemandem gegenüber fair.

Stattdessen wurde die Behauptung in ein leiseres „Grillengeräusch auf einem Feld“ für 12 Sekunden geändert, um die Länge des Videos zu füllen.

Das Besondere an der Option „Soundeffekte (SFX)“ ist, dass man mehrere Tonspuren hinzufügen und deren Position mithilfe von Griffen anpassen kann.

Mit einer Zeitleiste am unteren Bildschirmrand fühlt es sich eher wie ein echter Audioeditor an (zumindest teilweise). Durch Ziehen der Lautstärkeregler können Sie die Lautstärke anpassen oder eine Spur löschen.

Lohnt sich der Aufwand?

Insgesamt gibt es einige Verbesserungen an der Benutzeroberfläche, die ich mir hier wünschen würde, um den Produktionsablauf zu beschleunigen.

Ich glaube nicht, dass es professionelle Sounddesigner, Komponisten und Musiker in absehbarer Zeit ersetzen wird. Aber nach meiner Arbeit im Marketing sehe ich seinen Platz für Marketer und die alltägliche Videoproduktion.

Die Sprachausgabe hat sich seit den Zeiten der Microsoft Sam-ähnlichen Roboterstimmen stark weiterentwickelt, aber für eine präzise Sprachwiedergabe geht nichts über einen professionellen Sprecher im Studio.

Soundeffekte bieten jedoch einen weitaus größeren Vorteil. Über viele Generationen hinweg konnte ich die von der KI generierten Geräusche nicht von denen einer alten Soundeffekt-CD unterscheiden, die ich besaß.

Der eigentliche Gewinner ist die Funktion „Musik generieren“. Schon die einfachste Version erzeugte einen Klang, der sich sowohl für Produktvorführungen und Rezensionen als auch für Geschäftspräsentationen und Ähnliches eignete. Und die Qualität verbesserte sich mit jeder Generierung.

Für schnelllebige Videoproduktionen ist dieses Update also einen Blick wert.

 

 

Kommentarfunktion ist geschlossen.