Voice est un mode d'entrée et de sortie de première classe dans Crew. Le fournisseur STT local par défaut s'exécute dans le processus et télécharge son propre modèle à la première utilisation, de sorte que la dictée fonctionne sans installer de binaire externe. Un fournisseur infonuagique AWS Transcribe facultatif est également disponible. La synthèse texte-parole locale Piper (TTS) pour les réponses ne nécessite aucun service infonuagique.
Les deux modes sont sur demande. L'entrée vocale ne se déclenche jamais avant que vous n'appuyiez sur le micro; la sortie vocale ne joue jamais à moins que vous ne l'activiez par session ou globalement.
Crew exécute un seul fournisseur STT local dans le processus. Il télécharge un modèle à la première utilisation et le maintient chargé, de sorte qu'un court énoncé est transcrit en quelques dizaines de millisecondes. Aucun binaire externe n'est requis. La dictée fonctionne dans les installations de bureau macOS.
Si une installation à partir du code source nécessite son décodeur audio, ouvrez Parametres → Voix et choisissez Télécharger le décodeur. Crew télécharge un décodeur vérifié quand il est disponible, au lieu de vous demander d'installer ffmpeg manuellement.
Deux tailles de modèle sont disponibles :
| Modèle | Taille du téléchargement | Notes |
|---|---|---|
base (par défaut) | ~148 MB | Rapide, fonctionne bien pour la plupart des dictées |
turbo | ~1.6 GB | Précision supérieure; un réglage turbo enregistré lors d'une installation antérieure fonctionne toujours |
La valeur par défaut pour les nouvelles installations est base. Un réglage turbo enregistré lors d'une installation antérieure est correctement résolu, mais déclenche le téléchargement plus volumineux.
{ "voice": { "stt_model": "base" } }
Pour une précision de niveau infonuagique, un fournisseur AWS Transcribe est disponible. Il diffuse l'audio vers AWS et nécessite le supplément voice ainsi que des identifiants AWS configurés dans votre environnement.
Installez le supplément :
pip install "kirocrew[voice]"
Configurez le fournisseur :
{ "voice": { "stt_provider": "transcribe" } }
Pendant votre dictée, les mots en cours apparaissent dans la zone de texte et se stabilisent lorsque le modèle consolide sa transcription. Un silence d'environ 1,5 seconde finalise l'énoncé. Cliquez de nouveau sur le bouton du micro pour arrêter plus tôt.
Le texte en direct est activé par défaut pour les nouvelles installations. Si vous avez effectué une mise à niveau depuis une version antérieure, vérifiez Paramètres → Voix pour l'activer.
Les hallucinations de silence du modèle et le texte passe-partout des sous-titres, comme « Thank you for watching », sont filtrés avant que le texte n'atteigne votre saisie.
Maintenez une touche enfoncée pour dicter, ou appuyez dessus pour verrouiller la dictée jusqu'à ce que vous appuyiez de nouveau. Configurez la touche, le mode et testez la bande dans Paramètres → Voix.
Joignez une note vocale comme fichier avec @filename. L'audio est transcrit automatiquement et intégré au message.
Piper est un moteur TTS neuronal local et rapide. Il s'exécute entièrement sur votre machine et diffuse l'audio mot par mot au fur et à mesure que l'agent génère sa réponse.
Les fichiers de voix Piper sont téléchargés à la première utilisation et mis en cache localement.
{ "voice": { "tts_provider": "piper", "tts_voice": "en_US-amy-medium", "tts_speed": 1.0 } }
| Clé | Valeur par défaut | Objectif |
|---|---|---|
voice.tts_provider | piper | Moteur TTS (seulement piper pour l'instant) |
voice.tts_voice | en_US-amy-medium | Fichier de voix Piper à utiliser |
voice.tts_speed | 1.0 | Vitesse de lecture (0,5 à 2,0) |
Voix disponibles : n'importe quel fichier de voix Piper. Déposez un fichier .onnx dans ~/.kiro/crew/voices/ et référencez-le par son nom de fichier.
Les réglages vocaux qui nécessitent un redémarrage de la passerelle proposent l'action de redémarrage directement dans le panneau des réglages. Vous n'avez pas besoin de naviguer ailleurs ni de trouver une commande de redémarrage distincte.
Le TTS ignore le contenu qui serait inécoutable :
Remplacez n'importe lequel de ces comportements depuis le panneau des réglages vocaux.
La sortie vocale s'arrête lorsque vous arrêtez le tour :
!stop dans Slack fait de même pour une utilisation multiplateformeL'interruption est bidirectionnelle : arrêter la réponse arrête aussi le TTS en plein mot.
L'entrée vocale est réservée au tableau de bord. Les notes vocales Slack fonctionnent grâce à la fonction de note vocale de Slack. Le Kiro CLI dispose de son propre mode vocal distinct; consultez le mode Voice du CLI.
La sortie vocale fonctionne partout où le tableau de bord est ouvert, y compris sur des hôtes distants accédés par un tunnel SSH ou un accès mobile.
voice installé et des identifiants configurés| Problème | Solution |
|---|---|
| Le bouton du micro ne fait rien | Accordez la permission d'accès au microphone du navigateur pour l'origine du tableau de bord |
| Le TTS est silencieux | Vérifiez la permission audio de l'onglet du tableau de bord; confirmez que la sortie audio du système n'est pas coupée |
| Le modèle STT n'est pas téléchargé | Vérifiez Paramètres → Voix et votre connexion réseau; le modèle se télécharge une seule fois, à la première utilisation |
| La transcription est inexacte | Essayez une pièce plus silencieuse, passez au modèle turbo ou utilisez AWS Transcribe pour une précision de niveau infonuagique |
| Le texte en direct ne s'affiche pas | Activez le texte en direct dans Paramètres → Voix |
| La modification d'un réglage exige un redémarrage | Utilisez l'action de redémarrage dans le panneau des réglages vocaux |
Voice