音声をテキストに変換

録音をアップロードすると、タイムスタンプと話者付きの書き起こしが返ってきます。どの行をクリックしても、それがどの瞬間に話されたかを聴いてから書き出せます。

MP3、WAV、M4A、OGG · 最長 30 分

タイムスタンプ + 話者今日はあと 3 回無料

文字起こしする権利のある録音をアップロードしてください。書き起こしはあなたのもので、音声は処理後に保持されません。

音声文字起こし毎日 3 回無料、各 10 分まで。有料プランは 1 分あたり 300 クレジット、最長 30 分。
0:00 / 0:33

どの行をタップしてもその箇所が再生されます。再生中は再生ヘッドの行が光ります。あなたの書き起こしもこのようになります。

01使い方

3 ステップで音声をテキストに文字起こしする

ソフトも、順番待ちも、録音に合わせて打ち込む作業も不要。コンバーターはブラウザで動き、書き起こしを専用ページで渡します。プレイヤーが上、書き出しボタンは期待どおりの場所です。

  1. 1

    音声ファイルをアップロード

    最長 30 分の MP3、WAV、M4A、OGG をドロップします。アップロード前に長さが読み取られ、今日の変換が無料か、いくらかかるかがページに表示されます。

  2. 2

    音声をテキストに変換

    「文字起こし」を押します。エンジンが一度聴き、すべての語を話された秒とともに書き取り、話者を分けます。10 分のファイルなら通常 1 分以内です。

  3. 3

    音声と照らし合わせてから書き出す

    書き起こしはプレイヤーの横に開きます。どの行でもクリックして聴き、フレーズを検索し、話者名を変更して、プレーンテキスト、タイムスタンプ付きテキスト、SRT、VTT をダウンロードします。

音声のテキスト変換にかかる時間

おおよそ録音の長さの 10 分の 1 です。3 分のボイスメモは数秒で、30 分のインタビューは 2 〜 3 分で戻ります。処理中はページにタイマーが出るので、推測する必要はありません。

02基礎知識

音声テキスト変換ツールとは?

音声テキスト変換ツール(audio to text)は、完成した録音からその書き起こしを作るソフトウェアです。話されたすべての語、話された瞬間、そして誰が話したか。ライブのマイクではなくファイルを扱うので、どの語を決める前にも録音全体を読めます。

音声テキスト変換 vs. 口述入力

口述入力は話しながら打ち、文全体を見ることはありません。コンバーターはファイル全体を読むので、句読点が正しい位置に入り、不明瞭な語は前後の語から判断され、各行に本当のタイムスタンプが付きます。話者を区別できるのも同じ理由で、会話全体を聴いてからラベルを付けます。

ツールより録音が大事な理由

どの文字起こしエンジンも、マイクが捉えた音を扱います。音楽、車、部屋の反響は語を落とします。ファイルが荒いなら、先にボイス分離でクリーンにしてから変換してください。書き起こしの差はコンバーターを変えるより大きいです。

どちらが必要?

話して入力するなら、スマートフォンや文書エディタ内蔵の口述入力を。手元の録音から言葉を時間と話者付きで取り出すなら、このコンバーターです。

03行をクリック

どの行をクリックしても、聴ける

多くのコンバーターは文字の壁と別のプレイヤーを渡し、一語確かめるにもスクラブが必要です。ここでは書き起こしと音声はひとつのもので、同じページにあり、すべての行が自分の秒数を知っています。

書き起こしが再生ヘッドに追従する

音声が再生されると、話されている行が強調され、見える位置に保たれます。別の行をクリックすれば再生がそこへ飛びます。引用の確認は 2 秒です。

検索してから聴く

フレーズを入力すると、それを含む行に絞り込まれます。ひとつクリックすれば、まさにその瞬間を聴いています。

音声そのものからのタイムスタンプ

各行は開始した秒を持ち、読み上げ速度からの推定ではなく計測されたものです。

名前を変えられる話者

二つの声は話者 1 と話者 2 になります。一度名前を変えれば、全行とすべての書き出しが更新されます。

04得られるもの

音声テキスト変換で得られるもの

1 回の変換で 4 つのファイル。すべて同じ時間付きセグメントから作られるので、プレーンテキスト、字幕、タイムスタンプ版が食い違うことはありません。

プレーンテキスト

話者が間を置いたり交代した箇所で段落が分かれ、メモ、文書、メールにそのまま貼れます。

タイムスタンプ付きテキストと字幕

同じ行に開始時刻を付けたもの、または動画タイムラインにそのまま載る SRT と VTT。

話者ラベル

インタビューや通話は各発言に話者が付いて返り、話者の名前はあなたが決めます。

どんな音声フォーマットでも

ポッドキャストの MP3、レコーダーの WAV、iPhone ボイスメモの M4A、メッセージアプリの OGG。コンバーターはすべて読みます。変換する前に変換する必要はありません。

05

音声テキスト変換の書き起こしはこう見える

これは 30 秒の二人の録音に対する本物の出力で、モックアップではありません。タイムスタンプは各行の開始位置を示し、話者ラベルはエンジンが付け、強調された行は再生ヘッドの下にある行です。

0:00話者 1Welcome back to the show. Today we're talking about turning recordings into text and why so many people still do it by hand.
0:07話者 2Thanks for having me. Honestly, the part people miss is that a clean recording makes everything downstream easier, the transcript, the captions, all of it.
0:17話者 1So what do you do when the audio is noisy, a cafe interview, wind on a phone recording, that kind of thing?
0:25話者 2Run it through a voice isolator first, then transcribe. The difference in accuracy is night and day, and it takes about a minute.

例の読み方

各行は話者の一回の発言で、長い発言は一、二文に分かれます。ある行の終わりと次の行の始まりの間隔が、録音の中の間です。つなぎ言葉は残します。人を編集した書き起こしは誰の声にも聞こえないからです。

録音が荒いと何が変わるか

エンジンが区切りに確信を持てない箇所では行が長くなり、珍しい名前は耳で綴られ、重なって話す話者は一行を共有することがあります。すべて書き起こし画面で直せますし、大半は先に音声をクリーンにすれば避けられます。

06活用シーン

人々は何を変換するか

一度話され、何度も読まれ、検索され、引用される必要があるものすべてに、録音のテキスト変換は役立ちます。最もよく使われる六つの用途と、タイムスタンプと話者ラベルがそれぞれに加えるものを紹介します。

ポッドキャストのエピソード

番組ノート用の引用を抜き出し、話題が出た分を見つけ、読者のために書き起こしを公開する。

インタビューとボイスメモ

すべての回答を話者付きの文字で手に入れ、引用の確認が必要なときは録音がワンクリック先にある。

講義とコース

録画した授業がタイムスタンプ付きのノートになり、学生は概念が説明されたまさにその分に戻れる。

会議

話者付きの書き起こしは、誰が何を約束したかの記録。1 時間再生する代わりに名前や日付を検索する。

字幕

SRT か VTT を書き出せば、時計と競って打たなくても動画に字幕が付く。

自分の声で読む台本

書き起こしは台本です。テキスト読み上げに送るか、自分の声をクローンして、マイクなしでその言葉を自分の声で聴き直せます。

できないこと

聞き取れなかった語は文字にならず、翻訳はせず、ライブ字幕でもありません。手元のファイルを、1 つ 30 分まで扱います。長い録音は自然な区切りで二つに分けて変換してください。

07比較

音声テキスト変換ツール vs. 手作業の書き起こし vs. 書き起こしサービス

録音をテキストにする方法は三つ。速さ、コスト、得られるものが違います。

音声テキスト変換ツール自分で打つ書き起こしサービス
所要時間1 分以内録音の 4 〜 6 倍数時間から数日
タイムスタンプ手作業場合による
話者ラベル手作業
行をクリックして聴く
10 分あたりのコスト毎日無料、その後クレジットあなたの 1 時間分単位の料金
自分の声で読み返す

コンバーターが正しい既定です。どのエンジンにも荒すぎる録音のときだけ自分で打ち、人間の保証が納品物の一部であるときだけサービスに払ってください。

08ベストプラクティス

よりクリーンな書き起こしを得るには

作業はエンジンがしますが、録音が後で直す語の数を決めます。三つの習慣で、「10 分直す」と「10 秒直す」の差の大半が埋まります。

いちばん大きな改善

ノイズです。声の背後の車、音楽、ファンの音は、クリーンな録音なら残る語を落とします。荒い音声はまずボイス分離を通してください。約 1 分で、書き起こしは目に見えて良くなります。

マイクは一本、近くに

4 人の真ん中にスマートフォンを置くと部屋を録音します。大きいより近いが大事です。

話者に最後まで話させる

重なった会話はどんな文字起こしエンジンにも最難関です。順番に話す録音はきれいに返ってきます。白熱したパネル討論は、二つの声が同じ秒に重なる箇所を見直してください。

名前は後で検索

珍しい名前や製品用語は書き起こしがつまずく場所です。検索して、一度直して、書き出す。

09よくある質問

よくある質問

音声テキスト変換ツールは無料ですか?

ログイン済みのアカウントなら毎日 3 回、各 10 分まで無料で、すべての書き出し形式が使えます。有料プランは 1 日の上限がなくなり、1 ファイル 30 分まで、分単位でクレジットを消費します。レートは料金ページをご覧ください。

音声をテキストに文字起こしするには?

ファイルをアップロードして「文字起こし」を押し、準備ができたら書き起こしを開きます。通常 1 分以内です。どの行でもクリックして聴き、テキストか字幕でダウンロードしてください。

変換できる音声フォーマットは?

MP3、WAV、M4A、OGG。1 ファイルあたり最大 50 MB、最長 30 分です。スマートフォンのボイスメモやポッドキャストのダウンロードはそのまま使えます。

タイムスタンプと話者ラベルは付きますか?

はい。各行には音声から取った開始時刻が付き、各発言は名前を変更できる話者に割り当てられます。一人だけの録音ではラベルは表示されません。

音声テキスト変換の精度は?

一人か二人のクリアな録音なら、注意深く聴いた人が書くものに近い精度です。ノイズ、遠いマイク、重なった会話で下がります。先に音声をクリーンにするのが何より効き、後で名前を検索すれば残りの大半が拾えます。

動画をテキストに変換できますか?

まだ直接はできません。動画から音声トラックを MP3 か WAV で書き出して変換し、SRT の書き出しで動画に字幕を付けてください。

対応言語は?

広く話されている言語のほとんどを、その言語のまま文字起こしします。言語は自動検出されます。

録音は保存されますか?

書き起こしとその音声は履歴に 30 日間残り、開き直して書き出せます。いつでも削除できます。アップロードしたファイルは他のどこにも保持されません。

音声をテキストに変換 — 録音を無料でオンライン文字起こし