O NueSpeak Apex é o motor proprietário de conversão de texto em fala do NueForm, criado especificamente para interações conversacionais em formulários. Ele alimenta tanto o agente de voz da telefonia quanto o recurso de narração TTS no navegador.
Arquitetura
O NueSpeak Apex é um modelo neural de TTS baseado em transformer, com uma arquitetura generativa multiescala. Ele processa o texto por meio de um pipeline hierárquico — compreensão semântica, previsão de prosódia e síntese de forma de onda acústica — para produzir fala natural e humana em tempo real.
Especificações Principais
| Especificação | Valor |
|---|---|
| Parâmetros do modelo | ~1,8 bilhão |
| Taxa de geração de tokens | 11 Hz |
| Idiomas suportados | Inglês, espanhol, francês, chinês, japonês, coreano, híndi, árabe e mais de 20 idiomas adicionais |
| Clonagem de voz | Zero-shot a partir de ≥10 segundos de áudio |
| Latência (tempo até o primeiro áudio) | < 280 ms (mediana) |
| Fator de tempo real | 0,04x (gera 25× mais rápido que o tempo real) |
| Saída de áudio | 24 kHz, PCM de 16 bits |
| Streaming | Entrega progressiva baseada em chunks |
Recursos
Clonagem de Voz Zero-Shot
O NueSpeak Apex pode replicar as características da voz de um falante a partir de uma única amostra de áudio de 10 segundos ou mais. O pipeline de clonagem extrai:
- Timbre — A qualidade tonal única da voz
- Contorno de pitch — Padrões naturais de entonação
- Velocidade de fala — Cadência e ritmo de base
- Características de sotaque — Marcadores regionais de pronúncia
Nenhum ajuste fino é necessário. A voz clonada fica disponível imediatamente após o processamento da amostra (normalmente de 2 a 4 segundos).
Design de Voz
Além da clonagem, o NueSpeak Apex oferece suporte ao design de voz baseado em texto. Descreva a voz que você quer em linguagem natural — por exemplo, "uma voz feminina calorosa e profissional com um leve sotaque britânico" — e o motor sintetiza um perfil de voz correspondente.
Controle de Prosódia
O motor oferece controle refinado sobre a prosódia da fala:
- Velocidade — Ajustável de 0,5× a 2,0× da taxa normal
- Ênfase — Marque palavras ou frases para receber destaque
- Pausas — Insira pausas naturais de duração configurável
- Emoção — Coloração emocional sutil (neutra, calorosa, energética, calma)
Síntese Multilíngue
O NueSpeak Apex oferece suporte nativo a mais de 28 idiomas sem troca de modelo. O motor detecta automaticamente o idioma de entrada e aplica os mapeamentos de fonemas, as regras de prosódia e os modelos de sotaque apropriados. A alternância de código (code-switching) dentro de uma única fala é suportada.
Otimização para Telefonia
Para chamadas telefônicas, o NueSpeak Apex aplica processamento adicional:
- Compatibilidade com codificação 8 kHz / μ-law para entrega em PSTN
- Gerenciamento de piso de ruído — Minimiza artefatos audíveis em alto-falantes de telefone
- Ritmo adaptativo — Entrega ligeiramente mais lenta em contextos telefônicos para melhorar a compreensão
- Cache — O áudio gerado é armazenado em cache por segmento de texto, eliminando sínteses redundantes
Desempenho
Benchmarks
Medidos na infraestrutura de produção sob carga típica:
| Métrica | Valor |
|---|---|
| Mean Opinion Score (MOS) | 4,32 / 5,0 |
| Taxa de Erro de Caracteres (similaridade do falante) | 3,1% |
| Tempo até o primeiro byte (P50) | 245 ms |
| Tempo até o primeiro byte (P95) | 410 ms |
| Vazão | 4 streams simultâneos por instância |
| Consumo de memória | ~3,6 GB de VRAM |
Comparação com Padrões do Setor
| Recurso | NueSpeak Apex | TTS em Nuvem (típico) | TTS de código aberto |
|---|---|---|---|
| Latência | < 280 ms | 300–800 ms | 500–2000 ms |
| Clonagem de voz | Zero-shot | Requer ajuste fino | Varia |
| Multilíngue | Mais de 28 idiomas | Mais de 40 idiomas | 5–15 idiomas |
| Streaming | Sim | Parcial | Raro |
| Pontuação MOS | 4,32 | 4,0–4,3 | 3,5–4,0 |
Integração
O NueSpeak Apex é profundamente integrado à plataforma do NueForm:
- Construtor de Formulários — O áudio TTS é gerado no momento da publicação para todas as perguntas elegíveis.
- Telefonia — Síntese em tempo real durante chamadas telefônicas ao vivo com latência abaixo de 300 ms.
- Designer de Voz — Crie vozes personalizadas a partir de descrições em texto ou amostras de áudio.
- Camada de Cache — Frases usadas com frequência são pré-sintetizadas e armazenadas em cache para entrega instantânea.
Qualidade de Áudio
O NueSpeak Apex gera fala com qualidade de estúdio a uma taxa de amostragem de 24 kHz. Para telefonia, o áudio é transcodificado para 8 kHz μ-law para entrega ideal na rede telefônica, preservando a inteligibilidade.
O modelo se destaca em:
- Soletração e ditado — Pronúncia clara, caractere por caractere, para endereços de e-mail, nomes e códigos.
- Números e datas — Leitura natural de conteúdo numérico com agrupamento apropriado.
- Tom conversacional — As respostas soam naturais e envolventes, não robóticas.
Privacidade e Segurança
- As amostras de voz usadas para clonagem são armazenadas criptografadas e nunca são compartilhadas com terceiros.
- O áudio é gerado na infraestrutura de GPU dedicada do NueForm — sem chamadas a APIs externas.
- As vozes clonadas ficam restritas à sua conta e não podem ser acessadas por outros usuários.
- Os dados de voz podem ser excluídos a qualquer momento nas configurações de Telefonia.