Texto a vozDesarrollo web

Protege tus créditos de TTS y pule tu audio: puntuación de contenido y normalización de texto

El texto en bruto produce un audio torpe y los endpoints públicos invitan al abuso. Así resuelven ambos problemas la puntuación de contenido y la normalización de texto de TTS2Go, sin añadir carga adicional.

Anthony Morris·
Protege tus créditos de TTS y pule tu audio: puntuación de contenido y normalización de texto

Integrar TTS de autoservicio en un sitio web choca, casi sin que te des cuenta, con dos problemas que tienen muy poco que ver con las voces, los modelos o las API. El primero es que el texto en bruto rara vez suena como quieres al salir por un altavoz. El segundo es que, en cuanto pones un endpoint de TTS en una página pública, cualquier desconocido puede llamarlo. TTS2Go aborda ambos con dos sistemas específicos: un proceso de normalización de texto que reescribe la entrada problemática antes de la síntesis, y una capa de puntuación de contenido con IA que solo aprueba automáticamente las solicitudes que de verdad corresponden a tu sitio. Este artículo explica los dos, por qué existen y por qué importa combinarlos.

Por qué el TTS de autoservicio es realmente difícil

Un SDK de navegador necesita saber a qué proyecto pertenece, y ese identificador vive en un código que los usuarios pueden inspeccionar. Puedes protegerlo con listas de dominios permitidos y límites de solicitudes, pero el identificador no es un secreto. Si alguien encuentra el endpoint, puede enviar solicitudes. Y cada una de ellas podría consumir tus créditos del proveedor si llega a la síntesis.

El primer impulso es exigir que una persona apruebe cada solicitud antes de generarla. Es lo correcto, y es lo que TTS2Go hace de serie. Pero también es una tarea que crece más rápido que el equipo que la hace. Cuando tienes tráfico real, la aprobación manual se convierte en una interrupción a tiempo completo.

En cuanto a la calidad, los proveedores de TTS no se ponen de acuerdo en cómo pronunciar patrones comunes. Una fecha como «2026-04-21» puede sonar como «April twenty-first, twenty twenty-six» en un motor y como «twenty twenty-six dash oh four dash twenty-one» en otro. Las monedas, las horas, las abreviaturas y los números grandes se comportan de forma impredecible. Tus redactores no controlan el funcionamiento interno del proveedor, y tu proveedor no conoce tu contenido.

El punto de partida: la aprobación manual

Todos los proyectos de TTS2Go empiezan con aprobación manual. Cuando el SDK lanza una solicitud de generación, esta llega a una cola en el panel. La revisas, la apruebas o la rechazas, y solo las solicitudes aprobadas consumen créditos. Es la opción segura por defecto y funciona: los equipos que quieren cuidar cada audio que sale con su voz tienen el control total.

Pero también es lento. Con suficiente tráfico, se convierte en el tipo de tarea que empiezas a desear poder delegar en una máquina.

Puntuación de contenido con IA: un portero para tu endpoint

La puntuación de contenido con IA es esa máquina. Para cada proyecto configuras un breve perfil de contenido: una descripción de qué trata tu sitio, su tipo, su idioma y algunos fragmentos de ejemplo. Cuando llega una solicitud de generación, TTS2Go envía el texto de la solicitud y el perfil a un modelo de lenguaje, que devuelve una puntuación del uno al diez con una breve justificación.

Tú eliges un umbral. Las solicitudes que lo igualan o lo superan se aprueban automáticamente y se envían a síntesis. Las que quedan por debajo pueden pasar a la cola manual o rechazarse directamente, según lo que tenga sentido para tu sitio. La escala no es binaria: los niveles van desde «spam o abuso» en la parte inferior, pasando por «poco relacionado», «coincidencia plausible» y «buena coincidencia», hasta «coincidencia perfecta» en la parte superior. Puedes ser tan estricto o tan permisivo como lo exija tu tipo de contenido.

El resultado es que los desconocidos que encuentran tu endpoint e intentan generar texto que no tiene nada que ver obtienen una puntuación baja y nunca llegan a la síntesis. El contenido legítimo de tus propias páginas obtiene una puntuación alta y se narra sin que tengas que intervenir. Solo revisas la franja intermedia, y solo cuando quieres.

La puntuación se calcula sobre el texto original y no sobre la versión normalizada, porque se trata de valorar si el contenido es apropiado, no de cómo sonará finalmente el audio.

Normalización de texto: un editor antes del micrófono

Una vez que el contenido se aprueba para su generación, la siguiente pregunta es cómo sonará. TTS2Go pasa cada solicitud aprobada por un proceso de normalización basado en reglas antes de que llegue al proveedor. Este proceso reescribe las partes del texto en bruto que los proveedores tratan de forma irregular: números enteros y decimales, fechas y horas, importes en varios formatos de moneda, porcentajes, números romanos y abreviaturas comunes como «Dr.», «Mr.» y «etc.».

«The invoice of $1,234.56 is due on 2026-04-21» se convierte en «The invoice of one thousand two hundred thirty-four dollars and fifty-six cents is due on April twenty-first, twenty twenty-six». «Chapter IV has 5 sections» se convierte en «Chapter four has five sections». Cada transformación es determinista, tiene su prueba unitaria correspondiente y no cuesta nada en tiempo de ejecución: todo es procesamiento local, sin llamadas adicionales a ninguna API en el proceso de síntesis.

Optar por reglas en lugar de por otra capa de IA es una decisión deliberada. Las reglas son predecibles: puedes reproducirlas, explicarlas y comparar sus cambios. Si un usuario oye algo extraño, puedes averiguar exactamente por qué y corregir la regla concreta que lo produjo. El audio es una interpretación, y toda interpretación necesita un guion que se pueda repetir.

Por qué importan los dos juntos

Los dos sistemas trabajan en extremos opuestos del proceso. La puntuación decide qué llega a la síntesis. La normalización decide cómo suena. Una protege tu presupuesto; la otra, la calidad del resultado. Si quitas la puntuación, tus créditos quedan expuestos; si quitas la normalización, tu audio pierde consistencia. Juntos, convierten una integración de TTS, que antes requería un moderador de contenido y un lingüista, en una línea de código del SDK.

Pruébalo en el panel

Los dos sistemas tienen demos en vivo en la barra lateral del panel. La página AI Content Scoring te permite pegar un texto de ejemplo y ver la puntuación exacta, la justificación y el veredicto de aprobación automática frente al perfil de contenido de cualquiera de tus proyectos. La página Speech Formatting tiene un cuadro Try-It que muestra la versión normalizada de lo que escribas, junto a ejemplos de antes y después. Ambas tienen límite de solicitudes, ninguna consume créditos y cada una refleja exactamente lo que hace producción cuando llega una solicitud real.

Si ya tienes un proyecto en TTS2Go, abre el panel y prueba las dos. Si estás empezando, crea un proyecto, añade el SDK de React a una página y deja que la cola manual recoja las primeras solicitudes: verás todo el proceso en acción de principio a fin.