NueForm

NueSpeak Apex

Technische Dokumentation zu NueSpeak Apex, NueForms proprietärer Text-to-Speech-Engine für Telefonie und Formular-Vorlesefunktion.

NueSpeak Apex ist NueForms proprietäre Text-to-Speech-Engine, eigens gebaut für konversationelle Formularinteraktionen. Sie treibt sowohl den Telefonie-Sprachagenten als auch die TTS-Vorlesefunktion im Browser an.

Architektur

NueSpeak Apex ist ein transformer-basiertes neuronales TTS-Modell mit einer generativen Multi-Scale-Architektur. Es verarbeitet Text durch eine hierarchische Pipeline — semantisches Verständnis, Prosodie-Vorhersage und akustische Wellenformsynthese — und erzeugt so natürliche, menschlich klingende Sprache in Echtzeit.

Wichtige Spezifikationen

SpezifikationWert
Modellparameter~1,8 Milliarden
Token-Generierungsrate11 Hz
Unterstützte SprachenEnglisch, Spanisch, Französisch, Chinesisch, Japanisch, Koreanisch, Hindi, Arabisch und über 20 weitere Sprachen
Voice CloningZero-Shot ab ≥10 Sekunden Audio
Latenz (Zeit bis zum ersten Audio)< 280 ms (Median)
Echtzeitfaktor0,04x (generiert 25× schneller als Echtzeit)
Audio-Ausgabe24 kHz, 16-Bit-PCM
StreamingChunk-basierte progressive Auslieferung

Funktionen

Zero-Shot Voice Cloning

NueSpeak Apex kann die Stimmcharakteristik eines Sprechers aus einer einzelnen Audioprobe von 10 Sekunden oder mehr replizieren. Die Cloning-Pipeline extrahiert:

  • Timbre — die einzigartige Klangfarbe der Stimme
  • Tonhöhenverlauf — natürliche Intonationsmuster
  • Sprechgeschwindigkeit — Grundtempo und Rhythmus
  • Akzentmerkmale — regionale Ausspracheeigenheiten

Kein Fine-Tuning erforderlich. Die geklonte Stimme ist sofort nach der Verarbeitung der Probe verfügbar (typischerweise 2–4 Sekunden).

Voice Design

Über das Cloning hinaus unterstützt NueSpeak Apex textbasiertes Voice Design. Beschreibe die gewünschte Stimme in natürlicher Sprache — zum Beispiel „eine warme, professionelle weibliche Stimme mit leicht britischem Akzent" — und die Engine synthetisiert ein passendes Stimmprofil.

Prosodie-Steuerung

Die Engine bietet feinkörnige Kontrolle über die Sprachprosodie:

  • Geschwindigkeit — einstellbar von 0,5× bis 2,0× der Normalgeschwindigkeit
  • Betonung — markiere Wörter oder Phrasen zur Hervorhebung
  • Pausen — füge natürliche Pausen konfigurierbarer Länge ein
  • Emotion — subtile emotionale Färbung (neutral, warm, energiegeladen, ruhig)

Mehrsprachige Synthese

NueSpeak Apex unterstützt nativ über 28 Sprachen ohne Modellwechsel. Die Engine erkennt die Eingabesprache automatisch und wendet passende Phonem-Zuordnungen, Prosodie-Regeln und Akzentmodelle an. Code-Switching innerhalb einer einzelnen Äußerung wird unterstützt.

Telefonie-Optimierung

Für Telefonanrufe wendet NueSpeak Apex zusätzliche Verarbeitung an:

  • 8 kHz / μ-law-Kodierung für die PSTN-Auslieferung
  • Grundrauschen-Management — minimiert Artefakte, die auf Telefonlautsprechern hörbar sind
  • Adaptives Tempo — etwas langsamere Sprechweise im Telefonkontext für bessere Verständlichkeit
  • Caching — generiertes Audio wird pro Textsegment zwischengespeichert, wodurch redundante Synthese entfällt

Performance

Benchmarks

Gemessen auf Produktionsinfrastruktur unter typischer Last:

MetrikWert
Mean Opinion Score (MOS)4,32 / 5,0
Zeichenfehlerrate (Sprecherähnlichkeit)3,1 %
Zeit bis zum ersten Byte (P50)245 ms
Zeit bis zum ersten Byte (P95)410 ms
Durchsatz4 gleichzeitige Streams pro Instanz
Speicherbedarf~3,6 GB VRAM

Vergleich mit Branchenstandards

FunktionNueSpeak ApexCloud-TTS (typisch)Open-Source-TTS
Latenz< 280 ms300–800 ms500–2000 ms
Voice CloningZero-ShotFine-Tuning erforderlichUnterschiedlich
Mehrsprachigkeit28+ Sprachen40+ Sprachen5–15 Sprachen
StreamingJaTeilweiseSelten
MOS-Wert4,324,0–4,33,5–4,0

Integration

NueSpeak Apex ist tief in die NueForm-Plattform integriert:

  • Formular-Builder — TTS-Audio wird beim Veröffentlichen für alle geeigneten Fragen generiert.
  • Telefonie — Echtzeit-Synthese während laufender Telefonanrufe mit Latenz unter 300 ms.
  • Voice Designer — erstelle eigene Stimmen aus Textbeschreibungen oder Audioproben.
  • Caching-Ebene — häufig verwendete Phrasen werden vorab synthetisiert und für die sofortige Auslieferung zwischengespeichert.

Audioqualität

NueSpeak Apex erzeugt Sprache in Studioqualität mit 24 kHz Abtastrate. Für die Telefonie wird das Audio in 8 kHz μ-law transkodiert — optimal für die Auslieferung im Telefonnetz bei erhaltener Verständlichkeit.

Das Modell glänzt bei:

  • Buchstabieren und Diktat — klare Aussprache Zeichen für Zeichen bei E-Mail-Adressen, Namen und Codes.
  • Zahlen und Daten — natürliches Vorlesen numerischer Inhalte mit passender Gruppierung.
  • Konversationston — Antworten klingen natürlich und ansprechend, nicht roboterhaft.

Datenschutz & Sicherheit

  • Für das Cloning verwendete Stimmproben werden verschlüsselt gespeichert und nie an Dritte weitergegeben.
  • Audio wird auf NueForms dedizierter GPU-Infrastruktur generiert — keine externen API-Aufrufe.
  • Geklonte Stimmen sind auf dein Konto beschränkt und für andere Nutzer nicht zugänglich.
  • Stimmdaten können jederzeit in den Telefonie-Einstellungen gelöscht werden.
Zuletzt aktualisiert: 20. Juli 2026