Blog

A virada da latência: como a SipPulse ultrapassou até os líderes de mercado

SipPulse - Equipe Tecnica22 de julho de 20266 min de leitura
Compartilhar
 A virada da latência: como a SipPulse ultrapassou até os líderes de mercado

A virada da latência

Nossa latência já foi um problema, e nós sabíamos. Depois de um esforço sério de engenharia, refizemos as medições contra os dois líderes de mercado, com regras idênticas. O resultado superou a nossa própria expectativa.

Vamos começar pela verdade incômoda

Durante um tempo, a latência da SipPulse não estava onde precisava estar. Nossas medições nos colocavam acima de dois segundos de resposta, e latência alta não é um detalhe técnico. É o cliente que começa a falar por cima do agente, se irrita e desliga. O atraso não aparece no relatório. Aparece na conversão.

Ninguém liga para um atendimento por voz e pensa "que latência alta". A pessoa só sente que o agente é lento. E vai embora. Nós ouvimos isso, e decidimos que não dava para conviver com esse número.

Então tratamos a latência como o problema número um

Não trocamos o modelo por um mais fraco para ganhar tempo. Fizemos o trabalho difícil: reprojetamos o que acontece entre a fala do cliente e a primeira palavra do agente. Passamos a gerar a resposta de forma antecipada, enxugamos o caminho de conexão e afinamos a detecção de fim de turno, aquele momento em que o sistema decide que o cliente terminou de falar.

Cada milissegundo foi caçado onde ele realmente mora. E quando terminamos a primeira rodada, refizemos o teste. Não contra nós mesmos, contra o mercado.

A régua não é a nossa. É a do setor.

Número sem referência não prova nada. Então fomos aos dois estudos independentes que o mercado usa.

A Hamming analisou mais de quatro milhões de chamadas de produção. A mediana do tempo de resposta voz a voz do mercado ficou entre 1,4 e 1,7 segundo, um intervalo que ela classifica como "funcional, mas com atraso perceptível". E traça uma linha vermelha: acima de 1,5 segundo, a conversa quebra e o usuário passa a falar por cima do agente. O ponto ideal, aquele em que a pessoa nem percebe que fala com uma máquina, fica entre 300 e 800 milissegundos.

A Cekura rodou um agente idêntico em seis plataformas por telefonia real e encontrou medianas de 1,7 a 3,2 segundos. Nenhuma abaixo de 1,7.

Guarde esses números. É contra eles que a virada se mede.

A virada

Na mesma metodologia, com o mesmo modelo e a mesma voz, este foi o placar do tempo de resposta voz a voz (mediana):

PlataformaTempo de resposta (P50)
SipPulse On-Premise0,72 s
Líder de Mercado 20,97 s
SipPulse Cloud1,29 s
Líder de Mercado 11,64 s

Agora cruze com a régua do mercado.

A SipPulse Cloud responde em 1,29 segundo. Está abaixo da mediana do mercado e, o que mais importa, abaixo da linha de 1,5 segundo onde a Hamming diz que a conversa quebra. Onde boa parte do setor opera no limite, a nossa nuvem opera com folga, e mais rápido que o Líder de Mercado 1.

A SipPulse On-Premise responde em 0,72 segundo. Entra no ponto ideal da conversa natural que a Hamming define entre 300 e 800 milissegundos. É o território que quase ninguém alcança, e onde a SipPulse chega com o processamento ao lado do cliente, à frente dos dois líderes.

E veio uma validação que não planejamos: o Líder de Mercado 1 mediu 1,64 segundo, exatamente dentro da mediana que a Hamming descreve a partir de quatro milhões de chamadas. A nossa medição e o estudo independente contam a mesma história. Não existe atestado melhor de que a régua é honesta.

A régua foi a mesma para todos

Comparação que engana não serve para nada. Então travamos tudo o que dava para travar nas plataformas de nuvem:

  • O mesmo modelo de linguagem, GPT-4.1.
  • O mesmo motor de voz e a mesma voz.
  • O mesmo roteiro, uma conversa de atendimento em português com sete interações.
  • A mesma métrica, voz a voz, extraída do áudio real da chamada, com um marcador acústico que aponta o instante exato em que o cliente para de falar.
  • O mesmo ambiente, cinco chamadas por plataforma.

O que muda de uma coluna para a outra é só a plataforma. A diferença nos números, portanto, é diferença de engenharia, não de método.

E a virada também é de preço

Velocidade é metade da decisão. A outra metade é quanto custa cada minuto de conversa. E aqui a vantagem deixa de ser competitiva e vira estrutural.

A SipPulse Cloud custa 32% menos por minuto que o Líder de Mercado 1, a mesma plataforma que agora superamos em velocidade. E custa 77% menos que o Líder de Mercado 2, menos de um quarto do preço por minuto.

No on-premise a conta é ainda melhor. Sem tarifa de plataforma, com o dado permanecendo na casa do cliente, o menor custo por minuto do mercado vem junto com a menor latência da comparação.

Traduzindo: você não precisa escolher entre rápido e barato. Nem entre nuvem e soberania do dado.

Para onde vamos agora

Fizemos o teste esperando confirmar uma melhora. Confirmamos uma virada. Com regras idênticas, a SipPulse Cloud passou um dos dois líderes de mercado em velocidade, a SipPulse On-Premise passou os dois, e ainda entregamos tudo isso por 32% a 77% menos.

E essa é a parte mais importante: são ganhos de arquitetura, e há mais na fila. Enquanto o mercado ainda discute como sair de 1,7 segundo, a SipPulse já entrega 0,72, e a distância só tende a aumentar.

Para quem constrói atendimento por voz de verdade, a conta ficou simples. A melhor latência não precisa vir com o pior preço.

Ouça a virada você mesmo

Os números você já viu. Agora ouça a diferença. Conheça os agentes de voz da SipPulse rodando no nosso agente de voz otimizado e com o nosso modelo de TTS próprio, a mesma engenharia que virou o jogo da latência. Fale com um agente e sinta a resposta chegar antes do que você está acostumado.

[Conheça os agentes de voz da SipPulse]


Metodologia: teste voz a voz por marcador acústico. GPT-4.1 e motor de voz idênticos nas plataformas de nuvem. A opção On-Premise roda com modelo de linguagem co-locado, a vantagem estrutural do processamento local. Cinco chamadas de sete interações cada, em ambiente de teste único. P50 é a mediana em regime de conversa. Concorrentes anonimizados como Líder de Mercado 1 e Líder de Mercado 2.

Referências de mercado: Hamming, "Voice AI Latency: What's Fast, What's Slow, and How to Fix It", com percentis de mais de 4 milhões de chamadas de produção. Cekura, "Voice Orchestration Benchmarks", com agente idêntico em seis plataformas por PSTN. A Cekura mede por telefonia, que adiciona a latência de PSTN, por isso adotamos a faixa de produção da Hamming como referência principal.

Artigos Relacionados