Text-to-SpeechWebentwicklung

TTS-Credits schützen und Audio verfeinern: Content-Scoring und Textnormalisierung

Rohtext erzeugt holpriges Audio, öffentliche Endpunkte laden zu Missbrauch ein. So löst TTS2Go mit Content-Scoring und Textnormalisierung beide Probleme – ohne zusätzlichen Overhead.

Anthony Morris·
TTS-Credits schützen und Audio verfeinern: Content-Scoring und Textnormalisierung

Wer Self-Service-TTS in eine Website einbaut, stößt schnell auf zwei Probleme, die mit Stimmen, Modellen oder APIs wenig zu tun haben. Erstens klingt Rohtext selten so, wie man ihn aus einem Lautsprecher hören möchte. Zweitens können Fremde einen TTS-Endpunkt ansprechen, sobald er auf einer öffentlichen Seite steht. TTS2Go begegnet beidem mit zwei eigenen Systemen: einer Pipeline zur Textnormalisierung, die holprigen Input vor der Synthese umschreibt, und einer KI-Ebene für Content-Scoring, die nur Anfragen automatisch freigibt, die wirklich zu deiner Website gehören. In diesem Beitrag gehen wir beide Systeme durch, erklären, warum es sie gibt, und zeigen, warum gerade die Kombination entscheidend ist.

Warum Self-Service-TTS wirklich schwierig ist

Ein Browser-SDK muss wissen, zu welchem Projekt es gehört – und diese Kennung steht in Code, den Nutzer einsehen können. Du kannst sie mit Domain-Allowlists und Rate Limits absichern, aber geheim ist die Kennung nicht. Wer den Endpunkt findet, kann Anfragen senden. Und jede dieser Anfragen könnte deine Provider-Credits verbrauchen, sobald sie bis zur Synthese durchkommt.

Der erste Impuls: Jede Anfrage muss vor der Generierung von einem Menschen freigegeben werden. Das ist richtig – und genau das macht TTS2Go standardmäßig. Allerdings wächst diese Aufgabe schneller als das Team, das sie erledigt. Sobald echter Traffic kommt, wird die manuelle Freigabe zur Dauerunterbrechung.

Auf der Qualitätsseite sind sich TTS-Anbieter uneinig, wie gängige Muster ausgesprochen werden. Ein Datum wie „2026-04-21“ wird von einer Engine vielleicht als „April twenty-first, twenty twenty-six“ gesprochen und von einer anderen als „twenty twenty-six dash oh four dash twenty-one“. Währungen, Uhrzeiten, Abkürzungen und große Zahlen verhalten sich allesamt unvorhersehbar. Deine Autoren haben keinen Einfluss auf die Interna des Anbieters, und dein Anbieter kennt deine Inhalte nicht.

Die Grundlage: manuelle Freigabe

Jedes TTS2Go-Projekt startet mit manueller Freigabe. Wenn das SDK eine Generierungsanfrage auslöst, landet sie in einer Warteschlange im Dashboard. Du prüfst sie, gibst sie frei oder lehnst sie ab – und nur freigegebene Anfragen verbrauchen Credits. Das ist die sichere Voreinstellung, und sie funktioniert: Teams, denen jedes einzelne Audio in ihrer Stimme wichtig ist, behalten die volle Kontrolle.

Sie ist aber auch langsam. Bei genug Traffic wird sie zu genau der Art Workflow, die man am liebsten einer Maschine überlassen würde.

KI-Content-Scoring: ein Türsteher für deinen Endpunkt

KI-Content-Scoring ist diese Maschine. Für jedes Projekt legst du ein kurzes Content-Profil an: eine Beschreibung, worum es auf deiner Website geht, ihren Typ, ihre Sprache und ein paar Beispiel-Textausschnitte. Geht eine Generierungsanfrage ein, schickt TTS2Go den Anfragetext zusammen mit dem Profil an ein Sprachmodell, das einen Score von eins bis zehn samt kurzer Begründung zurückgibt.

Du legst einen Schwellenwert fest. Anfragen, die ihn erreichen oder übertreffen, werden automatisch freigegeben und an die Synthese übergeben. Anfragen darunter landen entweder wieder in der manuellen Warteschlange oder werden direkt abgelehnt – je nachdem, was für deine Website sinnvoll ist. Die Skala ist nicht binär: Die Stufen reichen von „Spam oder Missbrauch“ ganz unten über „lose verwandt“, „plausibler Treffer“ und „guter Treffer“ bis zu „perfekter Treffer“ ganz oben. Du kannst so streng oder großzügig sein, wie es deine Content-Mischung erfordert.

Das Ergebnis: Fremde, die deinen Endpunkt finden und versuchen, themenfremden Text generieren zu lassen, bekommen einen niedrigen Score und kommen nie bis zur Synthese. Legitime Inhalte von deinen eigenen Seiten erzielen hohe Scores und werden ohne dein Zutun vertont. Du schaust dir nur den mittleren Bereich an – und auch nur, wenn du willst.

Das Scoring läuft auf dem Originaltext, nicht auf der normalisierten Fassung, denn beim Scoring geht es darum, ob der Inhalt passt – nicht darum, wie das Audio am Ende klingt.

Textnormalisierung: ein Lektor vor dem Mikrofon

Sobald ein Inhalt zur Generierung freigegeben ist, stellt sich die nächste Frage: Wie wird er klingen? TTS2Go schickt jede freigegebene Anfrage durch eine regelbasierte Normalisierungs-Pipeline, bevor sie beim Anbieter ankommt. Die Pipeline schreibt die Teile von Rohtext um, die Anbieter uneinheitlich behandeln: ganze Zahlen und Dezimalzahlen, Datums- und Zeitangaben, Währungen in verschiedenen Formaten, Prozentangaben, römische Zahlen und gängige Abkürzungen wie „Dr.“, „Mr.“ und „etc.“

Aus „The invoice of $1,234.56 is due on 2026-04-21“ wird zum Beispiel „The invoice of one thousand two hundred thirty-four dollars and fifty-six cents is due on April twenty-first, twenty twenty-six.“ Aus „Chapter IV has 5 sections“ wird „Chapter four has five sections.“ Jede Transformation ist deterministisch, durch einen eigenen Unit-Test abgedeckt und kostet zur Laufzeit nichts – alles wird lokal verarbeitet, ohne zusätzlichen API-Aufruf auf dem Weg zur Synthese.

Der regelbasierte Ansatz ist eine bewusste Entscheidung gegen eine weitere KI-Ebene. Regeln sind vorhersehbar: Du kannst sie reproduzieren, erklären und vergleichen. Wenn ein Nutzer etwas Seltsames hört, findest du genau heraus, warum, und korrigierst die konkrete Regel, die es verursacht hat. Audio ist eine Performance – und Performances brauchen ein reproduzierbares Skript.

Warum beides zusammen zählt

Die beiden Systeme arbeiten an entgegengesetzten Enden der Pipeline. Das Scoring entscheidet, was bis zur Synthese gelangt. Die Normalisierung entscheidet, wie es klingt. Das eine schützt dein Budget, das andere die Qualität deines Outputs. Ohne Scoring liegen deine Credits offen, ohne Normalisierung klingt dein Audio uneinheitlich. Zusammen machen sie aus einer TTS-Integration, die eigentlich einen Content-Moderator und einen Linguisten bräuchte, eine einzige Zeile SDK-Code.

Probier es im Dashboard aus

Für beide Systeme gibt es Live-Demos in der Seitenleiste des Dashboards. Auf der Seite „AI Content Scoring“ kannst du Beispieltext einfügen und siehst den genauen Score, die Begründung und das Urteil zur automatischen Freigabe – für jedes Content-Profil deiner Projekte. Die Seite „Speech Formatting“ hat ein „Try-It“-Feld, das die normalisierte Fassung von allem anzeigt, was du eintippst, direkt neben Vorher-nachher-Beispielen. Beide sind ratenbegrenzt, keine kostet Credits, und beide spiegeln exakt wider, was in Produktion passiert, wenn eine echte Anfrage eingeht.

Wenn du bereits ein TTS2Go-Projekt hast, öffne das Dashboard und probier beide aus. Wenn du gerade erst anfängst, leg ein Projekt an, bau das React-SDK in eine Seite ein und lass die manuelle Warteschlange die ersten Anfragen abfangen – so siehst du die komplette Pipeline von Anfang bis Ende in Aktion.