NueSpeak Apex ist NueForms proprietäre Text-to-Speech-Engine, eigens gebaut für konversationelle Formularinteraktionen. Sie treibt sowohl den Telefonie-Sprachagenten als auch die TTS-Vorlesefunktion im Browser an.
Architektur
NueSpeak Apex ist ein transformer-basiertes neuronales TTS-Modell mit einer generativen Multi-Scale-Architektur. Es verarbeitet Text durch eine hierarchische Pipeline — semantisches Verständnis, Prosodie-Vorhersage und akustische Wellenformsynthese — und erzeugt so natürliche, menschlich klingende Sprache in Echtzeit.
Wichtige Spezifikationen
| Spezifikation | Wert |
|---|---|
| Modellparameter | ~1,8 Milliarden |
| Token-Generierungsrate | 11 Hz |
| Unterstützte Sprachen | Englisch, Spanisch, Französisch, Chinesisch, Japanisch, Koreanisch, Hindi, Arabisch und über 20 weitere Sprachen |
| Voice Cloning | Zero-Shot ab ≥10 Sekunden Audio |
| Latenz (Zeit bis zum ersten Audio) | < 280 ms (Median) |
| Echtzeitfaktor | 0,04x (generiert 25× schneller als Echtzeit) |
| Audio-Ausgabe | 24 kHz, 16-Bit-PCM |
| Streaming | Chunk-basierte progressive Auslieferung |
Funktionen
Zero-Shot Voice Cloning
NueSpeak Apex kann die Stimmcharakteristik eines Sprechers aus einer einzelnen Audioprobe von 10 Sekunden oder mehr replizieren. Die Cloning-Pipeline extrahiert:
- Timbre — die einzigartige Klangfarbe der Stimme
- Tonhöhenverlauf — natürliche Intonationsmuster
- Sprechgeschwindigkeit — Grundtempo und Rhythmus
- Akzentmerkmale — regionale Ausspracheeigenheiten
Kein Fine-Tuning erforderlich. Die geklonte Stimme ist sofort nach der Verarbeitung der Probe verfügbar (typischerweise 2–4 Sekunden).
Voice Design
Über das Cloning hinaus unterstützt NueSpeak Apex textbasiertes Voice Design. Beschreibe die gewünschte Stimme in natürlicher Sprache — zum Beispiel „eine warme, professionelle weibliche Stimme mit leicht britischem Akzent" — und die Engine synthetisiert ein passendes Stimmprofil.
Prosodie-Steuerung
Die Engine bietet feinkörnige Kontrolle über die Sprachprosodie:
- Geschwindigkeit — einstellbar von 0,5× bis 2,0× der Normalgeschwindigkeit
- Betonung — markiere Wörter oder Phrasen zur Hervorhebung
- Pausen — füge natürliche Pausen konfigurierbarer Länge ein
- Emotion — subtile emotionale Färbung (neutral, warm, energiegeladen, ruhig)
Mehrsprachige Synthese
NueSpeak Apex unterstützt nativ über 28 Sprachen ohne Modellwechsel. Die Engine erkennt die Eingabesprache automatisch und wendet passende Phonem-Zuordnungen, Prosodie-Regeln und Akzentmodelle an. Code-Switching innerhalb einer einzelnen Äußerung wird unterstützt.
Telefonie-Optimierung
Für Telefonanrufe wendet NueSpeak Apex zusätzliche Verarbeitung an:
- 8 kHz / μ-law-Kodierung für die PSTN-Auslieferung
- Grundrauschen-Management — minimiert Artefakte, die auf Telefonlautsprechern hörbar sind
- Adaptives Tempo — etwas langsamere Sprechweise im Telefonkontext für bessere Verständlichkeit
- Caching — generiertes Audio wird pro Textsegment zwischengespeichert, wodurch redundante Synthese entfällt
Performance
Benchmarks
Gemessen auf Produktionsinfrastruktur unter typischer Last:
| Metrik | Wert |
|---|---|
| Mean Opinion Score (MOS) | 4,32 / 5,0 |
| Zeichenfehlerrate (Sprecherähnlichkeit) | 3,1 % |
| Zeit bis zum ersten Byte (P50) | 245 ms |
| Zeit bis zum ersten Byte (P95) | 410 ms |
| Durchsatz | 4 gleichzeitige Streams pro Instanz |
| Speicherbedarf | ~3,6 GB VRAM |
Vergleich mit Branchenstandards
| Funktion | NueSpeak Apex | Cloud-TTS (typisch) | Open-Source-TTS |
|---|---|---|---|
| Latenz | < 280 ms | 300–800 ms | 500–2000 ms |
| Voice Cloning | Zero-Shot | Fine-Tuning erforderlich | Unterschiedlich |
| Mehrsprachigkeit | 28+ Sprachen | 40+ Sprachen | 5–15 Sprachen |
| Streaming | Ja | Teilweise | Selten |
| MOS-Wert | 4,32 | 4,0–4,3 | 3,5–4,0 |
Integration
NueSpeak Apex ist tief in die NueForm-Plattform integriert:
- Formular-Builder — TTS-Audio wird beim Veröffentlichen für alle geeigneten Fragen generiert.
- Telefonie — Echtzeit-Synthese während laufender Telefonanrufe mit Latenz unter 300 ms.
- Voice Designer — erstelle eigene Stimmen aus Textbeschreibungen oder Audioproben.
- Caching-Ebene — häufig verwendete Phrasen werden vorab synthetisiert und für die sofortige Auslieferung zwischengespeichert.
Audioqualität
NueSpeak Apex erzeugt Sprache in Studioqualität mit 24 kHz Abtastrate. Für die Telefonie wird das Audio in 8 kHz μ-law transkodiert — optimal für die Auslieferung im Telefonnetz bei erhaltener Verständlichkeit.
Das Modell glänzt bei:
- Buchstabieren und Diktat — klare Aussprache Zeichen für Zeichen bei E-Mail-Adressen, Namen und Codes.
- Zahlen und Daten — natürliches Vorlesen numerischer Inhalte mit passender Gruppierung.
- Konversationston — Antworten klingen natürlich und ansprechend, nicht roboterhaft.
Datenschutz & Sicherheit
- Für das Cloning verwendete Stimmproben werden verschlüsselt gespeichert und nie an Dritte weitergegeben.
- Audio wird auf NueForms dedizierter GPU-Infrastruktur generiert — keine externen API-Aufrufe.
- Geklonte Stimmen sind auf dein Konto beschränkt und für andere Nutzer nicht zugänglich.
- Stimmdaten können jederzeit in den Telefonie-Einstellungen gelöscht werden.