Audio-Transkription (Sprache zu Text)

Wandle Sprach- und Audiodateien in Text um, lokal im Browser mit dem Whisper-Modell. Du waehlst die Sprache selbst aus (Deutsch oder Englisch), deine Datei verlässt das Geraet nicht.

Ergebnis erscheint hier …

Audio-Transkription: Sprache in Text umwandeln

Mit unserem Werkzeug Audio-Transkription schreibst du gesprochene Worte direkt im Browser in Text um. Du lädst eine Audio- oder Videodatei hoch, wählst die Sprache aus und bekommst nach kurzer Zeit ein sauberes Transkript, das du kopieren und weiterverwenden kannst. Aus Interviews, Meetings, Vorlesungen oder journalistischem Material wird so schnell eine schriftliche Fassung. Alles läuft zu 100 % lokal auf deinem Gerät: Deine Audiodatei wird an keinen Server gesendet und nirgends gespeichert.

Dafür arbeitet ein offenes Spracherkennungsmodell direkt in deinem Browser. Genutzt wird das Whisper-Modell in der kompakten Tiny-Variante, das in einem Web Worker läuft. Dadurch bleibt die Seite auch bei längeren Dateien bedienbar, während die Erkennung im Hintergrund rechnet. Du wählst selbst aus, ob dein Material auf Deutsch oder Englisch gesprochen ist, und das Modell arbeitet genau in dieser Sprache. Das Modell (etwa 40 MB) wird erst beim ersten Einsatz heruntergeladen und danach vom Browser zwischengespeichert.

So funktioniert es

Wähle eine Audiodatei aus (MP3, WAV, M4A, WebM und weitere Formate), lege die Sprache fest, ob Deutsch oder Englisch, und starte die Transkription. Das Tool erkennt die gesprochenen Worte und liefert dir den Text direkt auf der Seite. Du kannst den Text markieren und kopieren oder ihn für deine Notizen, Artikel und Dokumente weiterverwenden. Ein Export als Untertitel-Datei (SRT) ist in diesem Werkzeug noch nicht enthalten.

Wofür sich das Werkzeug eignet

  • Interviews: O-Töne und Gespräche nach dem Aufnehmen verschriftlichen
  • Meetings: Besprechungen und Videokonferenzen in Notizen überführen
  • Vorlesungen: aufgezeichnete Vorträge und Lehrinhalte als Text festhalten
  • Journalistisches Material: Recherchegespräche schneller auswerten
  • Sprachnotizen: eigene Diktate und Gedanken ohne Abtippen in Text bringen

Was das Werkzeug kann und was nicht

Die besten Ergebnisse erzielst du bei klarer Aussprache und vernünftiger Tonqualität. Extrem verrauschtes Audio oder ein sehr starker Akzent verringern die Genauigkeit spürbar. Sehr lange Dateien brauchen entsprechend länger und fordern das Gerät. Das Modell ist bewusst kompakt gehalten, damit es lokal ohne Server läuft, dafür ist die Trefferquote bei einfacher, deutlicher Sprache am höchsten. Ein SRT-Export für Untertitel ist noch nicht verfügbar, der Fokus liegt auf dem reinen Text-Transkript.

Hinweis zur Genauigkeit: Die Qualität der Transkription hängt maßgeblich von der Audioqualität ab. Bei klarer Aufnahme und deutlicher Aussprache sind die Ergebnisse am besten; bei starkem Hintergrundrauschen, mehreren überlappenden Sprechern oder starken Akzenten kann es zu Fehlern kommen. Prüfe das Transkript daher vor der Weiterverwendung. Stand: September 2026.

Häufige Fragen

Welche Dateien kann ich verwenden?

Gängige Audioformate wie MP3, WAV, M4A und WebM sowie die Tonspur aus Videodateien. Für die beste Genauigkeit wähle eine Aufnahme mit klarer Sprache und möglichst wenig Hintergrundgeräusch.

Werden meine Audiodateien an einen Server gesendet?

Nein. Die Transkription läuft vollständig in deinem Browser. Deine Audiodatei verlässt dein Gerät nicht, sie wird nicht an einen Server übertragen und nirgends gespeichert.

Muss ich eine Sprache auswählen?

Ja. Du wählst selbst, ob dein Audio auf Deutsch oder Englisch gesprochen ist. Das Modell arbeitet dann gezielt in dieser Sprache, was die Trefferquote deutlich erhöht.

Wird das Spracherkennungsmodell heruntergeladen?

Beim ersten Einsatz lädt der Browser das kompakte Whisper-Modell (etwa 40 MB) herunter. Danach wird es zwischengespeichert und steht für die nächsten Transkriptionen direkt zur Verfügung.

Wie genau ist die Erkennung?

Bei klarer Aussprache und vernünftiger Tonqualität erzielst du sehr gute Ergebnisse. Stark verrauschtes Audio oder ein sehr starker Akzent können die Genauigkeit verringern. Für reine Unterhaltungslänge oder sehr lange Dateien solltest du mehr Zeit einplanen.

Kann ich Untertitel (SRT) exportieren?

Noch nicht. Der Export als SRT-Untertiteldatei ist aktuell nicht Teil dieses Werkzeugs. Der Fokus liegt auf dem reinen Text-Transkript, das du kopieren und weiterverwenden kannst.