interage.ai

Configuração

Envio de áudio

Onde fica: Configuração › Envio de Áudio

Seu agente pode responder por mensagem de voz em vez de texto. A tela resume isso como "o agente pode enviar mensagens de áudio no WhatsApp usando text-to-speech". O que ele manda é o mesmo conteúdo que mandaria escrito, convertido pra fala, com a voz que você escolhe e ajusta aqui.

  1. Abra Configuração › Envio de Áudio.
  2. Na aba Selecionar Voz, escolha uma voz salva em Minhas Vozes, ou procure outra em Explorar Catálogo.
  3. Na aba Configurações, ajuste o estilo de voz, o ajuste fino, a duração máxima de cada áudio, e a instrução de quando seu agente deve usar áudio em vez de texto.
  4. Use Gerar e ouvir pra testar a voz antes de aplicar, e Salvar configuração quando estiver do jeito certo.

O estilo de voz muda o tom, não o conteúdo

Existem predefinições de estilo, cada uma pensada pra um momento diferente da conversa:

EstiloPensado pra
ProfissionalAtendimento padrão
AcolhedoraPrimeiro contato, tom mais empático
EnergéticaVendas e prospecção
EmpáticaReclamação, situação de suporte
Rápida e DiretaConfirmação, dado objetivo
CasualTom mais informal e próximo

Além da predefinição, há um bloco de ajuste fino pra calibrar a voz além do que o estilo pronto já cobre. E há dois modelos de voz pra escolher, com um tradeoff real: um prioriza qualidade em português (o áudio soa mais natural), o outro prioriza velocidade de resposta e custa metade, entregando o áudio mais rápido com uma qualidade um degrau abaixo. Qual compensa depende do que pesa mais pra sua operação: naturalidade da voz ou velocidade e custo por mensagem.

Duração máxima por áudio

Você define até quanto tempo um único áudio pode durar, numa escala de muito curto (por volta de 10 segundos) a muito longo (por volta de 60 segundos), passando por curto, médio e longo. Esse limite é o que decide quando uma resposta mais longa precisa ser dividida em mais de uma mensagem de voz. Veja mais abaixo.

A tela de envio de áudio, com o catálogo de vozes à esquerda e, à direita, os seis estilos de voz, os dois modelos com seu tradeoff, os controles de ajuste fino e as faixas de duração máxima
A tela de envio de áudio, com o catálogo de vozes à esquerda e, à direita, os seis estilos de voz, os dois modelos com seu tradeoff, os controles de ajuste fino e as faixas de duração máxima

Quando faz sentido trocar texto por voz

Áudio funciona melhor pra explicação mais longa (quando o texto passaria de uns 3 parágrafos ou 5 frases pra ficar claro) e pra momento que pede mais proximidade, como uma situação sensível em que um tom mais humano ajuda. Também entra quando o próprio cliente já demonstrou preferência mandando áudio primeiro: seu agente responde no mesmo formato.

Onde o áudio não é a escolha certa

Informação que o cliente vai precisar copiar ou consultar depois (endereço, link, um dado específico) não deve sair só em áudio: fica mais difícil de achar de novo numa conversa de WhatsApp do que um texto que dá pra rolar e reler. O mesmo vale pra confirmação curta, onde o áudio adiciona tempo sem adicionar clareza.

O efeito na conversa

Pra quem opera, a mudança prática é de tom, não de conteúdo: a mesma resposta chega com uma voz por trás, o que costuma soar mais pessoal em explicação longa ou situação delicada. Pra quem recebe, um áudio pede mais atenção no momento: a pessoa precisa ouvir tudo, sem poder escanear o texto por cima. Por isso vale reservar pra quando isso compensa.

Áudio longo sai em partes

Quando o conteúdo é extenso demais pra caber na duração máxima que você configurou, seu agente divide em mais de uma mensagem de voz, sempre quebrando entre frases completas, nunca no meio de uma ideia. Do lado do cliente, isso aparece como uma sequência curta de áudios em vez de um só muito longo.

Atualizado em 2026-08-28