case_1206

Claude Codeの音声入力|/voiceの設定と使えない時の確認

Claude Codeの音声入力|/voiceの設定と使えない時の確認

Claude Codeの音声入力は、/voiceで有効にしてSpaceキーで話す機能です。日本語にするlanguageの設定、押し続ける方式とタップする方式の違い、MacやWindowsでマイクが使えない時の確認を公式情報で整理しました。

2026年10月7日に、公式ドキュメントと v2.1.292 までの CHANGELOG を確かめてまとめた(確認日:2026年10月7日・Claude Code CHANGELOG)。Claude Code の音声入力(voice dictation)は、プロンプトをキーボードで打つ代わりに、話して入れる機能だ。話した言葉はその場で文字になってプロンプトの入力欄に入るので、1つのメッセージの中で声と入力を混ぜられる。/voice で有効にし、キーを押している間だけ録音するか、1回押して始めてもう1回押して送るかを選ぶ(Claude Code公式ドキュメント「Voice dictation」)。

初期状態では英語で文字にするので、日本語で話すなら language の設定が要る。この記事では、使う前の条件、有効にする手順、日本語の設定、hold と tap の違い、キーの変え方、使えない時の確認を順に書く。

この記事の要点

  • 有効にする:/voice。/voice hold、/voice tap、/voice off で方式の指定や無効化もできる。
  • 日本語:language を "japanese" か "ja" にする。空のままだと英語で文字になる。
  • hold(初期値):Space を押している間だけ録音し、Enter で送る。
  • tap:Space を押して録音を始め、もう一度押して止めると自動で送る(短すぎる時は送らない)。
  • 使えない時:claude.ai のアカウントでのサインインと、ターミナルのマイクの許可を見る。SSH とクラウドのセッションでは使えない。
  • 料金:文字起こしはメッセージやトークンを消費しない。
  • 対象読者:長い指示を打つのが手間な開発者、手元のマイクで Claude Code に話しかけたい人。

音声入力(/voice)とは|話した言葉がその場でプロンプトに入る

/voice を有効にすると、話した内容がその場で文字になり、プロンプトの入力欄に入る。打った文字と話した文字を同じメッセージの中で混ぜられ、文字は確定するまで薄い色で出る。hold の方式なら、エージェントビューでも使える。ディスパッチの入力欄や、ピークパネルの返信欄にフォーカスがある時に押し続けると、バックグラウンドのセッションに向けて話せる(Voice dictation)。バックグラウンドのセッションの扱いはClaude Codeバックグラウンドセッション完全ガイドで扱っている。

マイクからAnthropic のサーバーを経てプロンプトの入力欄へ流れ、プロジェクト名とブランチ名が聞き取りの手がかりとして渡され、文字起こしはトークンを消費せずと示した流れの図
マイクの音声は Anthropic のサーバーで文字になり、プロンプトの入力欄に入る

音声はAnthropicのサーバーで文字にする

録音したマイクの音声は Anthropic のサーバーに送られて文字になり、手元のパソコンでは処理しない。文字起こしは開発の言葉に合わせて調整されていて、regex、OAuth、JSON、localhost などを正しく聞き取る。いまのプロジェクト名と git のブランチ名も、聞き取りの手がかりとして自動で渡される(Voice dictation)。

料金と使用量への影響

文字起こしは Claude のメッセージやトークンを消費せず、/usage に出る上限にも数えない(Voice dictation)。

使う前に確かめる3つの条件

音声入力は、次の3つがそろって初めて動く(Voice dictation)。

claude.ai のアカウント、手元のマイク、WSL なら WSLgの3つの関門を通った先に/voiceがあり、API キー、SSH のセッション、クラウドのセッションは手前で止まることを示した図
3つの条件を通ると /voice が使える。API キーや SSH、クラウドのセッションでは通らない
条件 中身 使えない例
claude.ai のアカウント 文字起こしは claude.ai のアカウントで認証している時だけ使える Anthropic の API キーを直接使う設定、Amazon Bedrock、Google Cloud の Agent Platform、Microsoft Foundry
手元のマイク マイクのある手元のパソコンで Claude Code を動かす クラウドのセッション、SSH のセッション
WSL なら WSLg WSL で動かすなら WSLg が要る WSL1 など WSLg が無い環境(Windows で直接動かす)

WSLとLinuxで要るもの

WSLg は、Windows 10 か 11 で Microsoft Store から入れた WSL2 に含まれる(Voice dictation)。WSLg の中身は Microsoft のリポジトリで公開されている(GitHub「microsoft/wslg」)。録音には macOS・Linux・Windows とも組み込みのモジュールを使い、Linux でそれが読み込めない時は ALSA utils の arecord か SoX の rec に切り替える。どちらも無ければ、/voice がパッケージマネージャーに合わせた入れ方のコマンドを出す。Windows で Claude Code を動かす準備はClaude Code Windows導入7手順にある。

VS Code拡張でも使える

VS Code 拡張も、同じく claude.ai のアカウントで音声入力に対応している。ただし SSH、Dev Containers、Codespaces などの VS Code Remote のセッションでは使えない。マイクは手元にあり、拡張はリモートの側で動くからだ(Voice dictation)。VS Code 拡張はClaude Code IDE統合|VSCode・JetBrainsで扱っている。

有効にする手順|/voiceの4つの書き方

/voice を打つと音声入力が有効になり、マイクの確認が走る。macOS では、ターミナルにまだマイクの許可を出していなければ、ここで許可を求める画面が出る(Voice dictation)。

/voice
Voice mode enabled (hold). Hold space to record. Dictation language: en (/config to change).
コマンド 動き
/voice オンとオフを切り替える。方式は今のまま
/voice hold hold(押し続ける方式)で有効にする
/voice tap tap(タップする方式)で有効にする
/voice off 無効にする

設定ファイルに書く

音声入力の設定は、セッションをまたいで残る。/voice を打つ代わりに、ユーザーの設定ファイルに voice を書いてもよい(Voice dictation)。

{
  "voice": {
    "enabled": true,
    "mode": "tap"
  }
}

voice には enabled、mode("hold" か "tap")、hold の時だけ効く autoSubmit を書ける。enabled が true で mode を書かなければ hold になる。古い voiceEnabled という書き方は、v2.1.92 で voice に置き換わって非推奨になった。今も読み込まれるが、両方あれば voice.enabled が優先される(All settings)。設定ファイルの置き場所と優先順位はClaude Code settings.json設定完全ガイドで扱っている。

最初の3回はヒントが出る

有効にしてから最初の3セッションは、入力欄が空の時に hold space to speak というヒントが出る。キーを変えるとヒントの表示も変わる。ステータスラインを自分で設定している場合は出ない(Voice dictation)。

日本語で話すための設定|languageを合わせる

音声入力は、Claude の応答の言語を決める language の設定をそのまま使う。この設定が空なら、文字起こしは英語になる。日本語で話すなら、/config か設定ファイルで language を設定する。BCP 47 の言語コード(ja)でも、言語名(japanese)でもよい(Voice dictation)。

左は設定が空のままで英語で文字になり、右は"language": "japanese"を書いてjaでも同じく日本語で文字になり、/configからも設定できることを比べた図
language が空なら英語、japanese か ja にすると日本語で文字になる
{
  "language": "japanese"
}

対応する言語は20

文字起こしに対応する言語は、日本語(ja)を含む20だ(Voice dictation)。v2.1.69 で10の言語が足されて20になった(Claude Code CHANGELOG)。一覧にない言語を language に書くと、/voice を有効にした時に警告が出て、文字起こしだけ英語に戻る。Claude の文章の応答は、この影響を受けない。

日本語でも自動送信が働く

tap の方式や autoSubmit の自動送信は「3語以上」が条件だが、日本語・中国語・タイ語のように単語の間に空白を入れない言語でも語を数えるので、自動送信が働く(Voice dictation)。v2.1.195 で、こうした言語で自動送信が働かない不具合が直っている(Claude Code CHANGELOG)。

VS Code拡張の言語

VS Code 拡張では、language が空なら VS Code の accessibility.voice.speechLanguage の設定を使い、それも無ければ英語になる(Voice dictation)。language の設定そのものはClaude Codeを日本語で使う設定|language設定と文字化け対策で扱っている。

押し続ける方式(hold)の使い方

hold は、キーを押している間だけ録音し、放すと止まる方式で、初期値はこちらだ(Voice dictation)。

Space を押し続ける、keep holding…、listening…、放す、カーソルの位置に入るの順に上る階段と、最上段からEnterとautoSubmitの2つの送り方が分かれる図
Space を押し続けると待ちの後に録音が始まり、放すとカーソルの位置に入る

Spaceを押し続けると録音が始まる

Space を押し続けると録音が始まる。Claude Code はターミナルから届くキーリピートの速い連続で「押し続けている」と判断するので、録音が始まるまでに少し待ちがある。待っている間は入力欄の下に keep holding…、録音中は listening… と出る。録音中はカーソルが棒になり、マイクの音量に合わせて伸び縮みする。prefersReducedMotion をオンにしていれば動かない。

最初に入る空白は自動で消える

待ちの間にキーリピートで入った最初の数文字の空白は、録音が始まると自動で消える。Space を1回だけ押した時は、普通に空白が入る。押し続けを検出するのは、速い連続の時だけだからだ(Voice dictation)。

文の途中に話して足す

Space を放すと文字が確定し、カーソルの位置に入る。カーソルは入れた文字の最後に残るので、打つのと話すのをどんな順でも混ぜられる。もう一度押し続ければ続きを足せるし、先にカーソルを動かせば別の場所に入れられる。

放したら送る(autoSubmit)

初期状態では、キーを放すと文字が入るだけで、送るには Enter を押す。voice の設定で "autoSubmit": true にすると、文字が3語以上ある時は、放した時点で送る(Voice dictation)。

Spaceで録音が始まらない場所

Space で録音が始まるのは、そのキーが入力欄に文字を打つ場面だけだ。トランスクリプトの画面では Space はページ送り、vim モードの INSERT 以外ではコマンドになる。meta+k のような修飾キーの組み合わせにキーを変えておけば、そうした場面でも録音を始められる(Voice dictation)。

タップする方式(tap)の使い方

tap は、1回押して録音を始め、話してからもう1回押して止める方式だ。待ちがなく、押し続ける必要もない。/voice tap で有効にし、入力欄が空の状態で Space を押すと録音が始まる。録音中は ● REC · tap to send と出る。もう一度 Space を押すと止まる(Voice dictation)。

入力欄が空の時に始まる録音(● REC · tap to send)が、15秒の無音か合計2分でも止まり、3語以上の関門を通るとそのまま送信、通らないと入力欄に入るだけになることを示した図
止めた時に3語以上ならそのまま送信、短ければ入力欄に入るだけ

3語以上ならそのまま送信する

止めると文字が入り、3語以上あればそのまま送信する。それより短い時は入力欄に入るだけで送らないので、うっかり押して1語だけ送ってしまうことがない。最初のタップで録音が始まるのは入力欄が空の時だけなので、文章を打っている途中の空白は普通に入る。2回目のタップは、入力欄の中身にかかわらず録音を止める。15秒の無音が続くか、合計2分たつと、録音は自動で止まる(Voice dictation)。

holdとtapの選び方

項目 hold(初期値) tap
始め方 Space を押し続ける 入力欄が空の時に Space を1回押す
止め方 放す もう1回押す(15秒の無音か合計2分でも止まる)
待ち 押し続けを検出するまで少しある ない
送信 Enter で送る(autoSubmit で自動にできる) 3語以上なら自動で送る
キーリピート 要る 要らない

表は公式ドキュメントの説明を並べ直したものだ(Voice dictation)。

取り消す・キーを変える

EscかCtrl+Cで取り消す

録音を確定させずにやめるなら、Esc か Ctrl+C を押す。マイクが止まって文字は捨てられ、入力欄は録音を始める前の状態に戻る。録音が終わって文字にしている途中でも取り消せる。この時の Esc は Claude の応答を止めず、Ctrl+C も入力欄を消したり、終了に要る2回押しの1回目に数えたりはしない(Voice dictation)。

録音のキーを変える(voice:pushToTalk)

録音のキーは Chat の場面の voice:pushToTalk に割り当てられていて、初期値は Space だ。hold と tap のどちらにも、同じ割り当てが効く。~/.claude/keybindings.json で変えられる(Voice dictation)。この割り当ては v2.1.71 で入った(Claude Code CHANGELOG)。

{
  "bindings": [
    {
      "context": "Chat",
      "bindings": {
        "meta+k": "voice:pushToTalk",
        "space": null
      }
    }
  ]
}

キー選びの注意

voice:pushToTalk に割り当てられるキーは一度に1つだけで、別のキーを割り当てると Space の割り当ては置き換わる。上の例の "space": null はわかりやすくするための行で、省いても動きは変わらない。hold の方式では、v のような文字のキーは避ける。押し続けの検出にキーリピートを使うので、待ちの間に文字が入ってしまう。Space か、最初の1回で録音が始まる meta+k のような修飾キーの組み合わせにする。tap の方式には待ちがないので、たいていのキーが使える。Caps Lock のようにターミナルに届かないキーは割り当てられない(Voice dictation・Customize keyboard shortcuts)。

使えない・反応しない時の確認

「Unknown command: /voice」と出る

/voice は、claude.ai のアカウントでサインインしている時だけ使える。サインインしていなければ /login を打つ。ANTHROPIC_API_KEY、ANTHROPIC_AUTH_TOKEN、apiKeyHelper の設定、または他社経由の設定があると、それが claude.ai のサインインより優先されるので、外して Claude Code を起動し直す(Voice dictation)。

反応しない時の確認を中心に、Unknown command: /voiceには/login、Microphone access is deniedにはプライバシーとセキュリティ、WSLにはsox libsox-fmt-pulse、Spaceを押しても何も起きないには/voice tapを対応させた図
よく出る4つの症状と、まず試すこと

アカウントと組織のポリシーのメッセージ

Voice mode requires a Claude.ai account と出たら、使える claude.ai のサインインが見つかっていないので、/login でサインインし直す。Voice mode is disabled by your organization's policy は、組織の管理者のポリシーで音声入力が止められているという意味なので、管理者に確かめる(Voice dictation)。

Macでマイクの許可がない

Microphone access is denied と出たら、システム設定の「プライバシーとセキュリティ」→「マイク」で、ターミナルのアプリをオンにしてから /voice を打ち直す(Voice dictation・Apple サポート「Macのマイクへのアクセスを制御する」)。

ターミナルが一覧にない時

一覧にターミナルが出てこない時は、許可の状態をリセットして、次の /voice で macOS にもう一度聞かせる。手順は3つで、上から順に進める(Voice dictation)。

  • tccutil reset Microphone <bundle-id> を実行する。標準のターミナルなら com.apple.Terminal、iTerm2 なら com.googlecode.iterm2 を入れる。ほかのターミナルは osascript -e 'id of app "AppName"' で調べる(Voice dictation)
  • ターミナルを Cmd+Q で終了してから開き直す。ウィンドウを閉じるだけでは、起動中のプロセスに macOS はもう一度聞かない
  • Claude Code を起動して /voice を打ち、出てきた許可の画面で許可する

bundle ID を付けずに tccutil reset Microphone を実行すると、Zoom や Slack も含めた Mac のすべてのアプリのマイクの許可が取り消される。通話の最中には実行しない。

Windowsでマイクの許可がない

Windows では、設定の「プライバシーとセキュリティ」→「マイク」で、デスクトップアプリのマイクへのアクセスをオンにしてから /voice を打ち直す(Voice dictation・Microsoft サポート「Windows camera, microphone, and privacy」)。

WSLとLinuxで録音できない

メッセージ 対処
Voice mode requires SoX for audio recording(Linux) エラーに出たコマンドで SoX を入れる(例:sudo apt-get install sox)
Voice mode requires a microphone, but SoX could not open an audio capture device 録音できる機器が無い(サーバーやコンテナなど)。マイクのあるパソコンで動かす
Voice mode could not find a working audio recorder in WSL sudo apt install sox libsox-fmt-pulse を実行する

WSLg は音声を ALSA の機器ではなく PulseAudio に流すので、SoX には PulseAudio 用の部品が要る。sox だけを入れると ALSA 用の部品しか入らず、WSL には /dev/snd が無いので録音できない(Voice dictation)。

Spaceを押しても何も起きない

hold の方式で押し続けている間、入力欄を見る。空白がどんどん増えるなら音声入力がオフなので、/voice hold で有効にする。空白が1つか2つ入ってそれきりなら、音声入力はオンでも押し続けを検出できていない。OS でキーリピートを切っているとこうなるので、キーリピートの要らない /voice tap に切り替える。tap の方式で Space を押して空白が入る時は、入力欄が空かどうかを確かめる(Voice dictation)。

録音はできても文字にならない

メッセージ 意味と対処
No audio detected from microphone 録音が無音だった。既定の入力機器と、その音量を確かめる
No speech detected 音声は届いたが言葉を聞き取れなかった。マイクに近づき、雑音を減らし、language が話している言語と合っているか見る
Voice connection failed 接続に失敗して、文字起こしのサービスに届かなかった。ネットワークを確かめる
Voice stream error: WebSocket upgrade rejected with HTTP <status> サーバーが接続を断った。400 番台ならサインインが古いか、プロキシなどが間に入っている。/login でサインインし直し、VPN やプロキシを確かめる
Voice input is failing repeatedly and has been paused 10秒以内に3回失敗したので、最初の失敗から10秒たつまで止めている。マイクや音声の環境を直してから試す

文字がおかしい、ほかの言語になる時は、文字起こしが英語のままになっている。先に /config で言語を設定する(Voice dictation)。

想定シナリオ|レビューの指摘を声でまとめて渡す

ここからは構成例で、実在の企業や個人(チーム)の事例ではない。手元の Mac で Claude Code を使い、プルリクエストのレビューで気づいたことを長い文章で指示している開発者が、打つ手間を減らすために音声入力を入れる、という想定で手順を組む。

手順1|日本語とtapを設定する

{
  "language": "japanese",
  "voice": {
    "enabled": true,
    "mode": "tap"
  }
}

ユーザーの設定ファイルに書くと、どのプロジェクトでも同じ設定で始まる。language は Claude の応答の言語も決めるので、応答も日本語になる。

手順2|最初の許可を通す

/voice を打ち、macOS のマイクの許可の画面で許可する。許可の画面が出なければ、前の節の tccutil の手順でリセットする。

手順3|話す内容を短く区切る

tap の方式では、15秒の無音か合計2分で録音が止まる(Voice dictation)。指摘を1つずつ区切って話し、カーソルを動かしながら足していく。聞き違えた語は、送る前にキーボードで直す。

手順4|送る前に読み返したい時はholdに戻す

tap の方式では、3語以上なら自動で送られる(Voice dictation)。読み返してから送りたい時は /voice hold に戻し、Enter で送る。

よくある質問

Claude Codeで音声入力するには?

/voice を打つと有効になる。初期値の hold では Space を押している間だけ録音し、放すと文字が入力欄に入る。送るには Enter を押す。

日本語で音声入力できる?

できる。language を "japanese" か "ja" にする。空のままだと英語で文字にするので、日本語で話すと文字がおかしくなる。

音声入力は料金や使用量に影響する?

文字起こしは Claude のメッセージやトークンを消費せず、/usage の上限にも数えない。

Macでマイクが使えない時は?

システム設定の「プライバシーとセキュリティ」→「マイク」で、ターミナルのアプリをオンにする。一覧に出てこなければ tccutil reset Microphone <bundle-id> でリセットし、ターミナルを Cmd+Q で終了してから開き直す。

WindowsやWSLで使える?

Windows で使える。WSL では WSLg が要り、sudo apt install sox libsox-fmt-pulse で SoX の PulseAudio 用の部品を入れる。WSL1 のように WSLg が無い環境では、Windows で直接動かす(Voice dictation)。

SSHやWeb版のClaude Codeで使える?

使えない。手元のマイクが要るので、クラウドのセッションや SSH のセッションでは動かない。VS Code Remote のセッションも同じだ。クラウドのセッションはClaude Code web版の使い方|クラウドセッション7手順で扱っている。

あわせて読みたい

運営元 Uravation よりこの事例を自社の業務で試す場合のテーマ選定・評価・本番移行の確認項目を、無料のチェックリストにまとめています。 Claude Code業務自動化PoCチェックリストを受け取る(無料)

参考・出典

Next Step

この事例を、自社の業務に置き換える。

対象業務、利用データ、評価基準、社内展開の順番まで整理すると、AI開発ツール導入の失敗を減らせます。

導入を相談する

チームで学ぶなら: Claude Code 法人研修(2日間ハンズオン) / 1人で習得するなら: 個別指導(週1マンツーマン)