WAV をテキストに変換

レコーダーや編集ソフトが書き出す形式である WAV をアップロードすると、タイムスタンプと話者付きの書き起こしが返ってきます。どの行でもクリックして聴き、書き出せます。

MP3、WAV、M4A、OGG · 最長 30 分

タイムスタンプ + 話者今日はあと 3 回無料

文字起こしする権利のある録音をアップロードしてください。書き起こしはあなたのもので、音声は処理後に保持されません。

音声文字起こし毎日 3 回無料、各 10 分まで。有料プランは 1 分あたり 300 クレジット、最長 30 分。
0:00 / 0:33

どの行をタップしてもその箇所が再生されます。再生中は再生ヘッドの行が光ります。あなたの書き起こしもこのようになります。

01使い方

3 ステップで WAV をテキストに変換する

インストールするソフトはありません。WAV はそのまま入り、50 MB を超える場合は次のセクションで、書き起こしを一語も変えずに MP3 へ縮める方法を示します。結果はプレイヤーを上に置いた専用ページに開きます。

  1. WAV
    1

    WAV をアップロード

    最長 30 分、最大 50 MB のファイルをドロップします。アップロード前に長さが読み取られ、今日の変換が無料か、いくらかかるかがページに表示されます。

  2. 2

    WAV をテキストに変換

    「文字起こし」を押します。エンジンが一度聴き、すべての語を話された秒とともに書き取り、話者を分けます。10 分のファイルなら通常 1 分以内に返ってきます。

  3. 3

    音声と照らし合わせてから書き出す

    書き起こしはプレイヤーの横に開きます。どの行でもクリックして聴き、フレーズを検索し、話者名を変更して、プレーンテキスト、タイムスタンプ付きテキスト、SRT、VTT をダウンロードします。

どのくらいかかる?

おおよそ録音の長さの 10 分の 1 です。3 分のテイクは数秒で、30 分のインタビューは 2 〜 3 分で戻ります。処理中はページにタイマーが出ます。

WAV

02フォーマットについて

WAV ファイルとは何か、なぜこんなに大きいのか

WAV は非圧縮の PCM 音声で、フィールドレコーダー、Audacity、あらゆる DAW、そして多くの電話システムの既定の書き出し形式です。マイクが拾ったすべてのサンプルを順番にそのまま保存するため、WAV テキスト変換ツールに持ち込めるファイルの中で最も高品質で、同時に群を抜いて最も大きなファイルになります。
録音設定1 分あたりの容量50 MB に収まる長さ
48 kHz · 24 bit · ステレオ(スタジオ)≈ 17 MB≈ 3 分
44.1 kHz · 16 bit · ステレオ(CD 品質)≈ 10 MB≈ 5 分
16 kHz · 16 bit · モノラル(音声)≈ 1.9 MB≈ 26 分
同じ音声を 128 kbps の MP3 に≈ 1 MB≈ 50 分

サンプルレートとビット深度は書き起こしを変えない

エンジンは聴く前にすべてのファイルを音声用のサンプルレートまで落とすので、48 kHz・24 bit のスタジオ WAV が 16 kHz モノラルより多くの使える語を運ぶことはありません。書き起こしを変えるのは部屋、マイクまでの距離、重なった会話です。大きな WAV に含まれる余分なデータはミックスのためのもので、文字起こしのためのものではありません。

先に MP3 へ変換しても、何も失わない

WAV が 50 MB か 30 分を超えるなら、Audacity から 128 kbps の MP3 として書き出すか、次のインタビューではレコーダーを MP3 モードにしてください。書き起こしはまったく同じで、アップロードは約 10 倍速くなります。すでに収まっている WAV はそのままアップロードできます。

ファイル名はどうなるか

レコーダーや Audacity が付けた名前、多くは ZOOM0012.WAV のようなものが、書き起こしのタイトルとすべての書き出しの名前になります。アップロード前にファイル名を変えるか、あとでワンクリックで書き起こしの名前を変えてください。

モノラルかステレオか

文字起こしにはモノラルで十分です。左右のチャンネルに一人ずつのステレオ・インタビューも問題ありません。エンジンはチャンネルではなく声で話者を区別するからです。

03行をクリック

どの行をクリックしても、聴ける

フィールドレコーダーの 1 時間分は、一文を探してスクラブするには長すぎるファイルです。ここでは書き起こしと音声はひとつのもので、同じページにあり、すべての行が自分の秒数を知っています。

書き起こしが再生ヘッドに追従する

録音が再生されると、話されている行が強調され、見える位置に保たれます。別の行をクリックすれば再生がそこへ飛びます。引用の確認は 2 秒です。

検索してから聴く

フレーズを入力すると、それを含む行に絞り込まれます。ひとつクリックすれば、まさにその瞬間を聴いています。

音声そのものからのタイムスタンプ

各行は開始した秒を持ち、読み上げ速度からの推定ではなくファイルから計測されているので、編集ログに貼るタイムスタンプは正しい瞬間を指します。

名前を変えられる話者

二つの声は話者 1 と話者 2 になります。一度名前を変えれば、全行とすべての書き出しが更新されます。

04得られるもの

WAV の書き起こしで得られるもの

1 回の変換で 4 つのファイル。すべて同じ時間付きセグメントから作られるので、プレーンテキスト、字幕、タイムスタンプ版が食い違うことはありません。

プレーンテキスト

話者が間を置いたり交代した箇所で段落が分かれ、メモ、文書、メールにそのまま貼れます。

タイムスタンプ付きテキストと字幕

同じ行に開始時刻を付けたもの、または動画タイムラインにそのまま載る SRT と VTT。

話者ラベル

インタビューや通話は各発言に話者が付いて返り、話者の名前はあなたが決めます。

書き起こしの保存先

各書き起こしは音声とともに履歴に 30 日間残り、ページを開き直して再生し、後で書き出せます。アップロードした WAV は他のどこにも保持されず、書き起こしを削除すると両方が消えます。

WAV

05WAV の出どころ

WAV ファイルはどこから来るか

WAV はプロ用機材と編集ソフトが既定で書き出す形式なので、たいてい四つの場所からやって来ます。それぞれに、次の録音の前に知っておく価値のある設定があります。

フィールドレコーダー

Zoom、Tascam、Sony のレコーダーは初期設定で WAV を書き出します。音楽には正解で、インタビューには重すぎます。多くの機種には MP3 モードもあるので、音声なら切り替えて変換の手順ごと省いてください。

Audacity と DAW

テイクをトリミングして整えたあと、書き出しダイアログの既定は WAV です。ファイルが文字起こし行きなら MP3 を選んでください。書き起こしは同じで、ファイルは 10 分の 1 の大きさになります。

電話システムと通話録音

サポート窓口や電話インタビューはたいてい 8 kHz の狭帯域 WAV を書き出します。小さくて、問題なく文字起こしできます。細く騒がしいことが多いので、先にボイス分離を通すと書き起こしが目に見えて良くなります。

スタジオセッションとナレーションのテイク

ポッドキャストのスタジオやナレーション収録は、大きくてクリーンな WAV を残します。テイクの書き起こしは台本なので、スタジオを再予約せずに、そのままテキスト読み上げやクローン音声で一言だけ撮り直せます。

できないこと

聞き取れなかった語は文字にならず、音声そのものは翻訳せず、ライブ字幕でもありません。手元の WAV を、1 つ 50 MB・30 分まで扱います。大きいものは MP3 に縮めるか、自然な区切りで分けてください。

06よくある質問

よくある質問

WAV ファイルとは何ですか?

非圧縮の PCM 音声で、レコーダー、Audacity、DAW、電話システムの既定の書き出し形式です。マイクが捉えたすべてのサンプルを保持するため、最も良い音で、最も容量を取ります。

WAV をテキストに変換できますか?

はい。WAV をアップロードして「文字起こし」を押すと、タイムスタンプと話者ラベル付きの書き起こしが開きます。どの行でもクリックして聴き、テキストか字幕でダウンロードしてください。

WAV が 50 MB を超えています。どうすれば?

Audacity や任意のエディタから 128 kbps の MP3 として書き出せば、CD 品質の WAV は約 10 分の 1 に縮みます。または自然な区切りで二つのファイルに分けてください。どちらでも書き起こしは同じです。

文字起こしの前に WAV を MP3 に変換すべきですか?

サイズか長さの上限を超えている場合だけです。収まっている WAV はそのままアップロードできます。変換しても文字起こしでは何も失われません。エンジンはもともと音声用のサンプルレートで動くからです。

サンプルレートやビット深度は精度に影響しますか?

いいえ。同じテイクの 48 kHz・24 bit ファイルと 16 kHz・16 bit ファイルは同じ書き起こしになります。変えるのはマイクまでの距離、背景ノイズ、重なった会話です。

話者を区別しますか?

はい。各発言は名前を変更できる話者に割り当てられ、モノラルでもステレオでも同じように動きます。一人だけの録音ではラベルは表示されません。

WAV を Word に変換できますか?

プレーンテキストの書き出しをダウンロードして Word や Google ドキュメントに貼り付けてください。文書に時刻を入れたければタイムスタンプ付きの書き出しを。段落は話者が間を置いたり交代した箇所ですでに分かれています。

WAV で保存した曲を文字起こしできますか?

エンジンは話し声のために作られているので、ミックス済みの曲は途切れ途切れになります。先にボーカルリムーバーで分割し、分離したボーカルトラックを文字起こししてください。そのほうがはるかにうまくいきます。

WAV をテキストに変換 — WAV ファイルを無料でオンライン文字起こし