O que você vai precisar
Passo a passo
1. Instale os componentes de voz locais
Instale os serviços de STT, TTS e wake word disponíveis para seu tipo de instalação. Em Home Assistant OS, add-ons simplificam o processo; em Docker, containers separados dão mais controle.
Dica: Anote portas e nomes dos serviços. Pipeline de voz quebra muito por endpoint errado.2. Adicione serviços Wyoming quando necessário
Use a integração Wyoming para conectar o Home Assistant aos serviços de voz que rodam em outro processo ou em outra máquina da rede.
Dica: Separar Whisper em outro mini PC costuma melhorar a resposta em instalações carregadas.3. Crie um novo assistente de voz
Em Configurações > Assistentes de voz, adicione um assistente, escolha idioma, STT, agente de conversação e TTS. Salve com nome claro, como “Assist local PT-BR”.
Dica: Não apague o pipeline anterior até testar o novo.4. Teste comandos simples
Comece com luzes e cenas de nomes curtos. “Ligar sala” é melhor que “ativar iluminação indireta aconchegante do ambiente social”.
Dica: Nome de entidade ruim vira erro de reconhecimento disfarçado.5. Ajuste microfone, wake word e modelo
Se a ativação falha, ajuste wake word e entrada de áudio. Se a transcrição erra, troque modelo de STT. Se a fala soa estranha, teste outra voz Piper.
Dica: Mude uma variável por vez. Trocar tudo junto impede saber o que melhorou.
Na mesa onde fica o mini PC do Home Assistant, o teste é simples: fale baixo, espere o bip curto do microfone e peça para acender uma luz. Se a resposta demora 6 segundos, a casa parece hesitar. Se responde em 1 ou 2 segundos, vira controle de verdade.
O pipeline de voz local tem quatro peças que se puxam em cadeia. Primeiro vem a palavra de ativação. Depois, o áudio vira texto. Em seguida, o Home Assistant entende a intenção. Por fim, a resposta volta em voz sintética. Quando uma peça é fraca, a próxima paga a conta.
O que é um pipeline de voz no Home Assistant?#
Pipeline é a rota que o áudio percorre dentro do Assist. Você escolhe idioma, wake word, STT, agente de conversação e TTS. O Assist pode rodar com serviços locais no próprio hardware ou em outro computador da rede via Wyoming. Essa segunda opção é ótima quando o Home Assistant está num Raspberry Pi e o reconhecimento de voz pesa demais.
Quais componentes fazem o trabalho local?#
Whisper costuma cuidar do reconhecimento de fala. Piper gera a fala de resposta. openWakeWord detecta a palavra de ativação. Wyoming funciona como a ponte entre o Home Assistant e esses serviços. O som do clique do relé é instantâneo; a voz não será. Ela precisa processar áudio, texto e intenção.
Preciso de hardware forte para usar voz local?#
Para comandos curtos, um mini PC x86 simples já entrega experiência melhor que boa parte dos SBCs. Raspberry Pi 4 funciona, mas modelos grandes de STT podem deixar tudo arrastado. Se você quer voz em português com resposta rápida, comece com modelo pequeno e só aumente quando tiver base de comparação.
Como criar o pipeline local?#
Em Configurações, Assistentes de voz, adicione um assistente. Escolha o idioma, selecione o mecanismo de fala para texto, o agente Home Assistant e o mecanismo de texto para fala. Depois, teste com frases curtas: “acender luz da sala”, “desligar ventilador”, “qual a temperatura do quarto”.
Como testar sem se enganar?#
Teste em três distâncias: 50 cm, 2 m e do outro lado do ambiente. Depois ligue TV ou música baixa. Microfone ruim faz o pipeline parecer burro. Muitas vezes o erro não está no Whisper nem no Assist; está no áudio chegando abafado, com eco e ventilador no fundo.
Voz local ainda exige ajuste fino, principalmente em português. Mas a troca é boa: comandos básicos ficam dentro da rede, sem depender da internet para apagar a luz. O ponto de corte é claro: abaixo de 2 segundos de resposta, a casa obedece; acima de 5 segundos, a pessoa volta para o interruptor.


