Voice est un mode d'entrée et de sortie de première classe dans Crew. Le fournisseur par défaut — Piper — s'exécute localement, si bien que rien ne quitte votre machine. La reconnaissance vocale (STT) infonuagique via AWS Transcribe est un supplément facultatif.
Les deux modes sont sur demande. L'entrée vocale ne se déclenche jamais avant que vous n'appuyiez sur le micro; la sortie vocale ne joue jamais à moins que vous ne l'activiez par session ou globalement.
Maintenez enfoncé ou cliquez sur le bouton du micro dans le champ de saisie du clavardage du tableau de bord.
En arrière-plan, l'audio est diffusé en continu vers /api/stt (WebSocket), qui l'achemine vers le fournisseur choisi et renvoie les événements de transcription en temps réel.
Configurez le fournisseur STT dans ~/.kiro/crew/config.json :
{ "voice": { "stt_provider": "whisper" } }
| Fournisseur | S'exécute où | Notes |
|---|---|---|
whisper (par défaut) | Local | Utilise Whisper localement si disponible; se rabat sur la reconnaissance vocale intégrée du navigateur |
aws_transcribe | Infonuagique | Nécessite le supplément d'installation voice + des identifiants AWS |
browser | Local (navigateur) | Utilise l'API Web Speech du navigateur — la qualité varie selon le navigateur |
Installez le supplément STT infonuagique :
pip install "kirocrew[voice]"
Joignez une note vocale comme fichier avec @filename — l'audio est transcrit automatiquement et intégré au message. Utile lorsque vous voulez laisser une note vocale dans un message existant sans déclencher le micro en direct.
Piper est un moteur TTS neuronal local et rapide. Il s'exécute entièrement sur votre machine (aucune connexion Internet requise) et diffuse l'audio mot par mot au fur et à mesure que l'agent génère sa réponse.
Les fichiers de voix Piper sont téléchargés à la première utilisation, puis mis en cache localement.
{ "voice": { "tts_provider": "piper", "tts_voice": "en_US-amy-medium", "tts_speed": 1.0 } }
| Clé | Valeur par défaut | Objectif |
|---|---|---|
voice.tts_provider | piper | Moteur TTS (seulement piper pour l'instant) |
voice.tts_voice | en_US-amy-medium | Fichier de voix Piper à utiliser |
voice.tts_speed | 1.0 | Vitesse de lecture (0,5–2,0) |
Voix disponibles : n'importe quel fichier de voix Piper. Déposez un fichier .onnx dans ~/.kiro/crew/voices/ et référencez-le par son nom de fichier.
Le TTS est conçu pour s'effacer en arrière-plan :
Vous pouvez remplacer chacun de ces comportements depuis le panneau des paramètres vocaux.
La sortie vocale peut être interrompue de la même façon qu'un tour de clavardage :
!stop dans Slack fait de même pour une utilisation multiplateformeL'interruption est bidirectionnelle : arrêter la réponse arrête aussi le TTS en plein mot.
L'entrée vocale est réservée au tableau de bord pour l'instant. Les notes vocales Slack fonctionnent grâce à la fonction de note vocale de Slack. Le Kiro CLI dispose de son propre mode vocal distinct (reconnaissance vocale Whisper locale); consultez le mode Voice du CLI.
La sortie vocale fonctionne partout où le tableau de bord est ouvert — y compris sur des hôtes distants accédés par un tunnel SSH ou un tunnel mobile. Le flux audio est livré sous forme de messages WebSocket fragmentés, donc la latence dépend de votre réseau.
voice installé et des identifiants configurésPiper est le fournisseur par défaut, car c'est le seul qui ne quitte jamais la machine.
| Problème | Solution |
|---|---|
| Le bouton du micro ne fait rien | Accordez la permission d'accès au microphone du navigateur pour l'origine du tableau de bord |
| Le TTS est silencieux | Vérifiez la permission audio de l'onglet du tableau de bord; confirmez que la sortie audio du système n'est pas coupée |
| Voix Piper manquante | La première utilisation télécharge le fichier de voix; vérifiez ~/.kiro/crew/voices/ et la connectivité réseau |
| La transcription est inexacte | Essayez une pièce plus silencieuse, passez à aws_transcribe si vous avez besoin d'une précision de niveau infonuagique |
| Le STT s'arrête en plein milieu d'une phrase | La détection de silence est agressive — maintenez le bouton enfoncé plutôt que de cliquer pour parler |
Voice