Le mode vocal vous permet de dire vos requêtes au lieu de les taper. Votre voix est transcrite localement avec OpenAI Whisper (via whisper.cpp) et, par défaut, soumise automatiquement à l'assistant. Vous pouvez passer au mode révision avant envoi si vous préférez. Il s'exécute entièrement sur votre machine par défaut, donc aucun audio ne quitte votre ordinateur et aucune clé API en nuage n'est requise. Le modèle de reconnaissance vocale est téléchargé une seule fois, à la première utilisation.
/voice ou en maintenant Space enfoncée.Enter, ou laissez l'arrêt automatique se déclencher après une période de silence.voice.autoSubmit false.Recording, press ENTER when done... 3.5sec ░░░█████████
Le texte partiel s'affiche progressivement dans la zone de saisie pendant que vous parlez, afin que vous puissiez observer la transcription se former avant d'arrêter.
/voice
Démarre une seule session d'enregistrement dans le clavardage actuel.
Maintenez la touche Space enfoncée à l'invite pendant 1,5 seconde pour démarrer l'enregistrement. Relâchez Space pour arrêter et transcrire. Utile pour une saisie vocale rapide sans appuyer sur Enter.
Le modèle Whisper est téléchargé à la première utilisation, et le téléchargement n'est jamais silencieux.
La commande détecte qu'aucun modèle n'est présent.
Un panneau affiche le nom du modèle, sa taille (environ 148 Mo pour le modèle base par défaut) et sa licence (MIT). Appuyez sur y pour télécharger ou n pour annuler.
Le modèle est mis en cache sous ~/.cache/kiro/models/. Les enregistrements suivants démarrent instantanément.
Si vous déclenchez le mode vocal avec Space (appuyer-pour-parler) avant que le modèle soit téléchargé, Kiro vous invite à exécuter /voice pour la configuration interactive.
La transcription locale utilise whisper-rs (liaisons Rust pour whisper.cpp) et ne nécessite pas d'accès Internet après le téléchargement initial du modèle. Deux tailles de modèle sont disponibles :
| Modèle | Taille de téléchargement | Vitesse | Précision |
|---|---|---|---|
base (par défaut) | ~148 Mo | Plus rapide | Bonne |
small | ~466 Mo | Plus lent | Meilleure |
Définissez la taille du modèle :
kiro-cli settings set voice.modelSize small
Lorsque vous travaillez sur un poste de travail en nuage sans microphone, le mode vocal peut diffuser l'audio vers un petit serveur exécuté sur votre machine locale. Le mode vocal revient automatiquement au serveur distant lorsqu'aucun microphone local n'est détecté.
Configuration manuelle :
# On your local machine (the one with a microphone): kiro-cli voice-serve # Open a reverse tunnel when you SSH to the cloud desktop: ssh -R 19876:localhost:19876 cloud-desktop # On the cloud desktop, point voice mode at the tunnel before starting Kiro: export KIRO_VOICE_SERVER_URL=http://127.0.0.1:19876 kiro-cli
Vous pouvez aussi forcer le moteur distant pour une seule session avec /voice --model remote (la valeur par défaut est --model local-whisper).
Depuis votre machine locale, voice-cloud-setup démarre le serveur vocal local et ouvre le tunnel inverse :
kiro-cli voice-cloud-setup <cloud-hostname>
Ensuite, sur le poste de travail en nuage, définissez l'URL du serveur dans le même shell avant de démarrer Kiro et d'activer le mode vocal :
export KIRO_VOICE_SERVER_URL=http://127.0.0.1:19876 kiro-cli
L'assistant vérifie la connectivité SSH, démarre voice-serve localement et ouvre le tunnel inverse. Il ne configure pas actuellement voice.serverUrl sur le poste de travail en nuage.
| Option | Description |
|---|---|
--port <port> | Port pour le serveur vocal (par défaut : 19876) |
--remote-bin <path> | Chemin vers kiro-cli sur le poste de travail en nuage |
-i <identity> | Fichier d'identité SSH |
Le mode vocal utilise la détection d'activité vocale Silero pour distinguer la parole du bruit de fond. Il détecte quand vous commencez et arrêtez de parler, filtre les clics de clavier et le bruit de ventilateur, et pilote l'arrêt automatique par silence, ce qui évite les fausses transcriptions causées par le bruit ambiant.
Le contexte de la conversation récente est aussi transmis à la requête initiale de Whisper, ce qui améliore la précision pour les identifiants de code, les noms de fonctions et le vocabulaire propre au projet abordés plus tôt dans la session.
Le comportement du mode vocal est contrôlé via kiro-cli settings. Tous les paramètres sont facultatifs.
| Paramètre | Type | Valeur par défaut | Description |
|---|---|---|---|
voice.modelSize | string | base | Taille du modèle Whisper : base ou small |
voice.language | string | en | Langue de transcription (auto pour détecter) |
voice.silenceTimeout | integer | 5 | Secondes de silence avant l'arrêt automatique de l'enregistrement |
voice.maxSessionTime | integer | 300 | Durée maximale d'enregistrement en secondes |
voice.autoSubmit | boolean | true | Soumettre la transcription automatiquement au lieu de la placer dans la saisie pour révision |
voice.serverUrl | string | none | URL du serveur vocal distant pour les postes de travail en nuage |
Exemples :
# Favor speed kiro-cli settings set voice.modelSize base kiro-cli settings set voice.silenceTimeout 3 # Favor accuracy kiro-cli settings set voice.modelSize small kiro-cli settings set voice.silenceTimeout 8 # Review each transcription before it is sent kiro-cli settings set voice.autoSubmit false # Transcribe Spanish kiro-cli settings set voice.language es # View your voice settings kiro-cli settings list | grep voice
0700) en tant que défense en profondeur.> /voice Recording, press ENTER when done... 2.1sec ░░░████████ "Fix the bug in the authentication module" > Analyzing the authentication module...
How do ISpace enfoncée et dites : "implement pagination in the users API"Space pour arrêter et transcriresmall est plus précis mais plus lent, et il n'y a pas encore d'accélération GPU.| Problème | Solution |
|---|---|
| « No microphone detected » | Accordez la permission d'accès au microphone, ou configurez un serveur vocal distant sur un poste de travail en nuage |
| L'enregistrement s'arrête trop tôt | Augmentez voice.silenceTimeout (par exemple, à 10) |
| Précision de transcription médiocre | Passez au modèle small, parlez clairement et réduisez le bruit de fond |
| La première utilisation est lente | Le modèle est téléchargé une seule fois à la première utilisation, puis les enregistrements démarrent instantanément |
| « Model integrity check failed » | Kiro supprime le fichier invalide et le télécharge à nouveau automatiquement. Si le problème persiste, vérifiez votre réseau ou votre proxy |
| « Voice binary not found » | Réinstallez kiro-cli, ou confirmez que KIRO_CHAT_CLI_BIN pointe vers une version compilée avec la fonctionnalité voice |
| Utilisation élevée du CPU pendant la transcription | Utilisez le modèle base et laissez une transcription se terminer avant de commencer une nouvelle tâche |
Mode vocal