Audio mit Hintergrundgeräuschen transkribieren (und wann Sie es vorher säubern sollten)
Was tun, wenn die Aufnahme Rauschen, Hall oder Musik enthält: wann Sie das Original transkribieren, wann Sie das Audio vorher säubern, kostenlose Tools und wie Sie künftig besser aufnehmen.
Sonorarium-Team 3 Min. Lesezeit
Kurz gesagt: Transkribieren Sie zuerst das Original, ohne es zu bearbeiten: Aktuelle Modelle vertragen einiges an Geräuschen, und eine zu aggressive Rauschunterdrückung kann das Ergebnis verschlechtern. Kommen einzelne Passagen schlecht heraus, säubern Sie das Audio (Audacity oder ein „Sprachverbesserer“) und transkribieren nur diese Fassung erneut. Und beim nächsten Mal: Mikrofon näher heran – das hilft am meisten.
Welche Art von Geräusch haben Sie?
Nicht jedes Problem ist gleich, und jedes hat seine Lösung:
| Problem | Beispiele | Auswirkung | Was tun |
|---|---|---|---|
| Gleichmäßiges Rauschen | Klimaanlage, Lüfter, entfernter Verkehr | Gering, wenn die Stimme klar ist | Unverändert transkribieren; nur bei Fehlern säubern |
| Wechselnde Geräusche | Café, Straße, Stimmen im Hintergrund | Deutlich: Das Modell „hört“ Wörter anderer Personen | Säubern und sorgfältig prüfen |
| Hall | Große Säle, Kirchen, leere Hörsäle | Stark: Silben verschwimmen | Nachträglich schwer zu beheben; vorbeugen |
| Hintergrundmusik | Videos, Podcasts mit Jingle, Events | Unterschiedlich; bei lauter Musik stark | Musik im Schnitt absenken oder Stimme trennen |
| Entfernte oder leise Stimme | Rekorder am anderen Ende des Raums | Stark | Lauter machen und säubern; vorbeugen |
| Überlappende Stimmen | Mehrere Personen gleichzeitig | Eine Stimme geht verloren | Nur durch eine Redeordnung vermeidbar |
Schritt 1: Probieren Sie das Original
- Laden Sie die Datei in das Transkriptionstool.
- Wählen Sie die Sprache manuell: Bei Geräuschen kann die automatische Erkennung in den ersten Sekunden danebenliegen.
- Tippen Sie auf Transkribieren und prüfen Sie das Ergebnis, indem Sie zweifelhafte Stellen im Editor anhören.
Ist der Text bis auf wenige Stellen gut, korrigieren Sie diese am schnellsten von Hand. Scheitert es in der ganzen Datei, gehen Sie zu Schritt 2.
Schritt 2: Säubern Sie das Audio
- Audacity (kostenlos): Markieren Sie einen Abschnitt, der nur Rauschen enthält → Effekt → Rauschverminderung → „Rauschprofil ermitteln“; dann alles markieren und mit moderater Absenkung (6–12 dB) anwenden. Übertreiben Sie es, klingt die Stimme „metallisch“ und das Ergebnis wird schlechter.
- KI-Sprachverbesserer: Tools wie Enhance Speech von Adobe Podcast (kostenlos mit Limits) trennen die Stimme von Rauschen und Hall. Bei einer sprechenden Person funktioniert das sehr gut; bei mehreren prüfen Sie, dass niemand „verschluckt“ wird.
- Stimme-Musik-Trenner: Ist Musik das Problem, lassen sich mit Spurtrennungs-Tools nur die Stimmen behalten.
- Normalisieren Sie die Lautstärke, wenn die Stimme sehr leise ist (Audacity → Effekt → Normalisieren).
Exportieren Sie als WAV, FLAC oder MP3 in guter Qualität und transkribieren Sie diese Fassung. Vergleichen Sie mit dem ersten Transkript und behalten Sie das bessere.
Schritt 3: Prüfen Sie, wo es am häufigsten hakt
Bei Geräuschen häufen sich Fehler bei Eigennamen, Zahlen und seltenen Wörtern. Prüfen Sie diese besonders und markieren Sie, was auch nach mehrmaligem Anhören unverständlich bleibt, als [unverständlich 00:12:45], statt zu raten.
So nehmen Sie auf, damit es nicht wieder passiert
- Mikrofon näher heran. Das wirkt am stärksten: das Handy weniger als einen Meter von der sprechenden Person, bei nur einer Person am besten eine Handbreit entfernt.
- Wählen Sie den Raum: klein, mit Möbeln, Vorhängen oder Teppichen; meiden Sie leere Räume und Cafés.
- Schalten Sie Lärmquellen aus: Lüfter, Beamer, Benachrichtigungen.
- Bei Videocalls ein Headset nutzen und den Ton des Anrufs aufnehmen, nicht den Lautsprecher.
- Machen Sie einen 30-Sekunden-Test und hören Sie ihn vor dem Start mit Kopfhörern an.
Mehr Tipps je nach Situation unter Interview transkribieren, Vorlesung transkribieren und Meeting-Transkription.
Häufige Fragen
Warum erfindet die Transkription Sätze in Pausen oder bei Musik? Sprachmodelle können Passagen ohne klare Sprache mit plausibel klingendem Text „auffüllen“. Sehen Sie Sätze, die niemand gesagt hat, an Stellen mit Musik oder Geräuschen, löschen Sie sie beim Prüfen.
Gilt ein Telefonat als Audio mit Geräuschen? Es ist schmalbandiges Audio: Es wird gut transkribiert, aber prüfen Sie Namen und Zahlen genauer. Es gibt eine Anleitung zu aufgezeichneten Telefonaten.
Lohnt es sich, für das Säubern zu bezahlen? Nur wenn die Aufnahme unwiederbringlich ist und das Ergebnis zählt (ein Schlüsselinterview, ein Beweismittel). Ansonsten probieren Sie zuerst das Original und die kostenlosen Optionen.