Onde fica: Validação › Langfuse
O menu chama esta tela de "Langfuse". Esse é o nome da ferramenta técnica que sustenta o que você vê aqui. Mas o que ela responde no dia a dia é mais direto: seu agente está respondendo bem? Enquanto Observabilidade fala de custo, tempo e transferência pra humano, esta tela fala de qualidade, separada por agente, nos últimos 7 dias.
Um recorte por agente
A tela se divide em três abas: Receptivo, Estudante, Follow-up. Qualidade não é a mesma pergunta pros três: o que conta como uma boa resposta do Receptivo, que conversa em tempo real, não é o mesmo critério que vale pro Estudante, que só analisa em segundo plano.
Os seis sinais de qualidade
| Sinal | O que ele te diz |
|---|---|
| Feedback humano (conversas) | O que seu time marcou como boa ou ruim durante um atendimento real: a mesma avaliação de Central da IA |
| Feedback humano (Go-Live) | O que foi marcado durante uma simulação de Go-Live, antes de ir ao ar |
| Feedback humano (teste) | O que foi marcado num teste comum, fora do fluxo de Go-Live |
| Alucinação de tool | Quantas vezes o agente afirmou ter feito algo sem ter executado de fato, ou usou uma ferramenta de um jeito que não bate com o resultado |
| Endereça pergunta | Se a resposta respondeu o que a pessoa perguntou |
| Loops detectados | Quantas vezes, nas últimas 24 horas, o agente ficou repetindo a mesma coisa sem avançar a conversa. Zerado é o esperado |
Depois dos seis sinais
A tela continua com o uso de ferramentas do agente na janela analisada, e uma lista das conversas mais recentes. Ela serve para quando o número sozinho não basta e você quer ver os casos reais por trás dele.
Quando ir além desta tela
