Conceito

Pontuação de Confiança da Intenção

Em sistemas NLU, a pontuação de confiança da intenção é um valor numérico associado à correspondência entre uma fala e uma classe, frequentemente normalizado entre 0 e 1. Ela ajuda a decidir se o sistema executa, pede confirmação, solicita esclarecimento ou rejeita. Não é uma probabilidade universal de acerto: depende do modelo, do conjunto de intenções, da calibração e da distribuição de uso. Em casa inteligente, limiares devem variar por risco; um comando de luz pode tolerar incerteza maior que abertura de portão, que exige confirmação independente.


Definição aprofundada

Em classificadores de intenção, a pontuação de confiança resume a força com que uma entrada foi associada a uma classe. Algumas plataformas retornam um valor entre 0 e 1; outras fornecem logits, margens, ranks ou categorias. O número não possui significado universal. Um score 0,90 pode estar mal calibrado e errar mais do que sugere. A interpretação depende do modelo, das intenções concorrentes, do idioma, do ruído e dos dados reais. Na automação residencial, a pontuação deve alimentar uma política de decisão proporcional ao risco: executar, confirmar, esclarecer, encaminhar ou negar. Ela não substitui autenticação, autorização nem validação de slots. A confiança do classificador descreve a classificação, não a segurança da ação.

🔑Pontos-chave
  • A origem do score varia. Em um classificador softmax, a maior saída normalizada pode ser tratada como confiança relativa, mas softmax tende a ser superconfiante fora da distribuição. Em modelos de similaridade, o score pode ser cosseno; não é probabilidade. Em LLMs, pedir “dê sua confiança de 0 a 1” produz uma autoavaliação textual, não necessariamente calibrada. A documentação do sistema precisa dizer. O pipeline armazena score bruto, intenção vencedora, segunda colocada e margem. A diferença entre as duas pode ser informativa. Se `turn_on_light=0,72` e `open_blind=0,70`, há ambiguidade mesmo que 0,72 pareça alto. O contexto e slots também importam.
  • Calibração compara scores com frequências observadas. Métodos como temperature scaling, Platt scaling, isotonic regression e binning podem ajustar em conjunto de validação. Um sistema calibrado que emite 0,8 deveria estar correto aproximadamente 80% naquele grupo, sob distribuição semelhante. Mudanças de idioma, microfone, ASR, usuários e intenções quebram. Avaliar continuamente. Diagramas de confiabilidade, Expected Calibration Error e Brier score ajudam. Não calibrar no mesmo conjunto usado para treinar. Em casa, dados reais devem ser anonimizados e consentidos. A calibração por dispositivo ou idioma pode melhorar, mas exige amostra. Sem volume, use políticas conservadoras e confirmação.
  • Limiar é decisão de produto e risco, não propriedade do modelo. Um comando reversível como ligar luz pode executar acima de um limiar moderado e oferecer feedback. Um ajuste de temperatura pode pedir confirmação se valor incomum. Destravar porta, desarmar alarme ou abrir portão não deve depender apenas do score; exige autenticação e confirmação. A política pode ter três faixas: alta, média e baixa. Alta executa ações de baixo risco; média pergunta “você quis apagar a luz da sala?”; baixa pede reformulação. Os valores são derivados de testes, não copiados. Custo de falso positivo e falso negativo é diferente. Para alarme, falso positivo de desarmar é grave.
  • A pontuação precisa ser combinada com confiança de entidades e estado. A intenção pode ser clara, mas o cômodo ambíguo. “Apague a luz” tem intenção alta e alvo ausente. Não execute. “Ajuste para quinze” pode ser temperatura, volume ou brilho. Slots têm scores ou validação. Contexto ajuda, mas pode introduzir erro. O sistema calcula decisão a partir de intenção, entidades, usuário, dispositivo, horário e risco. Uma regra pode exigir `intent_confidence>0.85`, todos os slots válidos e alvo único para luz. Para ações críticas, confirmação independentemente. O backend não aceita um único número como autorização.
  • ASR influencia. Uma transcrição errada pode receber alta confiança NLU para a frase errada. O sistema pode considerar alternativas N-best, score acústico, ruído e confirmação. Em campo distante, “não abra” pode virar “abra”. Negação requer teste. O NLU deve receber pontuação e texto, mas não confiar cegamente no ASR. Para ações sensíveis, repetir a intenção na UI e exigir toque/biometria. Wake word falso também. A confiança total é uma composição, não simples multiplicação sem calibração. Cada componente tem distribuição. O sistema registra áudio somente se consentido; preferir transcrição e métricas anonimizadas.
  • Monitoramento detecta drift. Métricas por intenção incluem precisão, recall, matriz de confusão, taxa de esclarecimento, cancelamento, correção do usuário e ação revertida. Um aumento de “ligar luz” confundido com “abrir persiana” indica sobreposição de frases. Atualizar exemplos ou separar. Novos nomes de cômodo. A troca de ASR pode mudar. Limiares são versionados e testados. Logs incluem score e decisão, não apenas sucesso. Usuários devem poder corrigir. O feedback não entra automaticamente no treino sem revisão. A pontuação é útil para governar incerteza, mas não deve ser apresentada como certeza matemática ou prova de que o usuário pretendia uma ação física.
Exemplos
Execução de luz com faixa de decisão
O usuário diz “apaga a luz da sala”. O NLU retorna intenção `turn_off`, score 0,94, alvo único e usuário autorizado. A política de baixo risco executa. Com score 0,68 e duas salas possíveis, pergunta. Abaixo de 0,45, solicita reformulação. Os limites foram ajustados em testes de português. O sistema mostra feedback e permite desfazer. Se o ASR detecta baixa qualidade por ruído, pode confirmar mesmo com score alto. A decisão usa intenção, slot, alvo e risco. A pontuação não é exibida ao morador como porcentagem de verdade.
Abertura de portão com confirmação obrigatória
A frase “abre o portão” recebe score 0,99. Ainda assim, a política classifica acesso físico como alto risco. O sistema abre uma confirmação no app, mostra o portão correto e exige biometria. Se o locutor não está identificado, nenhuma ferramenta é disponibilizada. O score ajuda a entender o pedido, não autoriza. Um score 0,60 gera esclarecimento antes da confirmação. A execução usa token curto e sensor. O resultado é informado somente após confirmação. Essa separação evita confundir acerto linguístico com permissão.
Detecção de drift após atualização do ASR
Depois de trocar o modelo de reconhecimento, a taxa de esclarecimento sobe de 8% para 19% em comandos de persiana. A análise mostra transcrições de “suba” como “sopa”. Os scores NLU caem. A equipe ajusta vocabulário do ASR e exemplos, recalibra e testa. Não reduz o limiar global, pois isso aumentaria falsos positivos. Métricas são separadas por cômodo e microfone. Áudios são usados apenas com consentimento e retenção curta. A versão anterior pode ser restaurada. A pontuação serve como sinal de saúde do pipeline.