AI 音声文字起こし
アップロードか録音で、タイムスタンプと話者ラベル付きの書き起こしを取得。どの行をクリックしても、それがどの瞬間に話されたかを聴けます。
MP3、WAV、M4A、OGG · 最長 30 分
文字起こしする権利のある録音をアップロードしてください。書き起こしはあなたのもので、音声は処理後に保持されません。
どの行をタップしてもその箇所が再生されます。再生中は再生ヘッドの行が光ります。あなたの書き起こしもこのようになります。
01—使い方
3 ステップで音声をテキストにする
すべてブラウザで完結します。口述ソフトのインストールも、エディタのプラグインも、アプリ間のコピーも不要。アップロードして、少し待って、読む。書き起こしはボタンの下ではなく専用ページに開き、プレイヤーが上、書き出しボタンは期待どおりの場所にあります。
- 1
アップロードまたは録音
最長 30 分の MP3、WAV、M4A、OGG をドロップするか、「録音」を押して話します。アップロード前に長さと、消費クレジットまたは「今日は無料」の表示が出ます。
- 2
文字起こし
「文字起こし」を押します。音声文字起こしエンジンが一度聴いて、すべての語を時間とともに書き取り、誰が話しているかを判定します。10 分の録音なら通常 1 分以内に返ってきます。
- 3
読んで、クリックして、書き出す
書き起こしは専用ページに開き、プレイヤーが上にあります。どの行でもクリックして聴き、フレーズを検索し、話者名を変更して、プレーンテキスト、タイムスタンプ付きテキスト、SRT、VTT をダウンロードします。
始める前に必要なもの
人が話している録音と、アカウント。それだけです。無料枠は 1 日 3 回、各 10 分まで。ほとんどのインタビュー、メモ、講義の一部はこれで足ります。
02—基礎知識
音声文字起こしとは?
音声文字起こし(speech to text)は、話された音声をソフトウェアで文字に変換することです。現代の音声文字起こしは録音全体を聴き、各語をそれが話された瞬間とともに書き取り、話者を区別できるため、結果は文字の壁ではなく時間軸付きの書き起こしになります。
音声文字起こし vs. 音声入力
スマートフォンや文書ソフトの音声入力はリアルタイムです。話すと打たれ、文全体を見ることはありません。録音の文字起こしは全体を一度に見るので、句読点を正しく打ち、前後の語から単語を判断し、各行にタイムスタンプを付けられます。話者を区別できるのも同じ理由で、会話全体を聴いてからラベルを付けます。
文字はどこから来るか
エンジンが扱うのはマイクが捉えた音です。背景音楽、風、部屋の反響は精度を下げます。録音が荒いなら、先にボイス分離を通してからクリーンな版を文字起こししてください。
どちらが必要?
話して入力したいなら、スマートフォンやワープロ内蔵の音声入力を。録音があって、その中の言葉を時間と話者付きで取り出したいなら、このページです。
03—行をクリック
どの行をクリックしても、聴ける
多くの文字起こしツールは文字の塊を渡し、単語ひとつ確かめるのに音声をスクラブさせます。ここでは書き起こしとプレイヤーはひとつのもので、同じページにあり、すべての行が自分の秒数を知っています。
書き起こしが音声に追従する
録音が再生されると、話されている行が光り、リストはそれを見える位置に保ちます。別の行をクリックすれば再生がそこへ飛びます。怪しく聞こえる語の確認は 2 秒で済み、探し回る必要はありません。
検索してから聴く
フレーズを入力すると、それを含む行だけに絞り込まれ、一致箇所が強調されます。ひとつクリックすれば、まさにその瞬間を聴いています。
信頼できるタイムスタンプ
各行は開始した秒を持っています。読み上げ速度からの推定ではなく音声そのものから取っているので、番組ノートに書く時刻が正しい瞬間を指します。
話者名はあなたが決める
二人の話者は話者 1 と話者 2 になります。一度名前を変えれば、書き起こしとすべての書き出しの全行が更新されます。
04—得られるもの
音声文字起こしで得られるもの
1 回の文字起こしで 4 つのファイル。すべて同じ時間付きセグメントから作られます。
プレーンテキスト
話者が間を置いたり交代したりした箇所で段落が分かれ、つなぎ言葉は残るので、書き起こしはその人らしく聞こえます。メモや文書、メールに貼るか、そのままテキスト読み上げに渡せます。
タイムスタンプ付きテキストと字幕
同じ行に開始時刻を付けたもの、または動画タイムラインにそのまま載る SRT と VTT。
話者ラベル
インタビューや通話は各発言に話者が付いて返ってきます。話者 1 を本名に変えれば、ラベルも追従します。
書き起こしの保存先
各文字起こしは音声とともに履歴に 30 日間保存され、ページを開き直して再生し、後で書き出せます。アップロードしたファイルは他のどこにも保持されず、削除した書き起こしは履歴とストレージから消えます。
05—活用シーン
人々は何を文字起こしするか
一度話され、何度も読まれる必要があるものすべてに、文字起こしの居場所があります。最もよく使われる六つの用途と、タイムスタンプと話者ラベルがそれぞれに加えるものを紹介します。
ポッドキャストのエピソード
番組ノート用の引用を抜き出し、話題が出た瞬間を見つけ、聴くより読む人のために書き起こしを公開する。
インタビューと通話
すべての回答を話者付きの文字で手に入れ、引用の確認が必要なときは録音に戻る。
講義とコース
録画した授業をタイムスタンプ付きのノートに。学生は概念が説明されたまさにその分に戻れる。
会議
話者付きの書き起こしは、誰が何を約束したかの記録。1 時間再生する代わりに名前や期日を検索する。
字幕
SRT か VTT を書き出せば、時計と競って打たなくても動画に字幕が付く。
自分の声で読む台本
書き起こしは台本です。テキスト読み上げに送るか、自分の声をクローンして、マイクなしでその言葉を自分の声で読み直せます。
できないこと
聞き取れなかった語は文字にならず、翻訳はせず、ライブ字幕サービスでもありません。すでにある録音を、1 回 30 分まで扱います。長い録音は自然な区切りで二つに分けて文字起こししてください。
06—比較
音声文字起こし vs. 音声入力 vs. 会議アシスタント
三種類の製品が「音声文字起こし」の名で呼ばれますが、解決する問題は違います。
| 音声文字起こし(このツール) | 音声入力 | 会議アシスタント | |
|---|---|---|---|
| 入力 | 手元の録音 | あなたのライブの声 | 参加するライブ通話 |
| タイムスタンプ | |||
| 話者ラベル | |||
| 行をクリックして聴く | 場合による | ||
| どんなファイルでも | |||
| 自分の声で読み返す |
話して入力したいなら音声入力。会議にボットを入れたいならアシスタント。録音があって言葉を取り出したい、音声もワンクリックで聴きたいなら、このページです。
07—ベストプラクティス
正確な書き起こしを得るには
作業はエンジンがしますが、何を渡すかで後で直す語の数が決まります。三つの習慣で、「10 分直す」と「10 秒直す」の差の大半が埋まります。
いちばん大きな改善
ノイズです。背後に車、音楽、ファンの音がある録音は、クリーンな録音なら残る語を落とします。荒い音声はまずボイス分離を通してください。約 1 分で、書き起こしは目に見えてきれいになります。
マイクは一本、近くに
4 人の真ん中にスマートフォンを置くと、人ではなく部屋を拾います。大きいより近いが大事で、真ん中の良いマイク一本より一人一本のマイクのほうが良い。
話者に最後まで話させる
重なった会話はどんな文字起こしエンジンにも最難関です。順番に話す録音はきれいに返ってきます。白熱したパネル討論は、二つの声が同じ秒に重なる箇所を見直してください。
名前は後で検索
珍しい名前や製品用語は書き起こしがつまずく場所です。後から検索し、文書で一度直してください。
08—よくある質問
よくある質問
音声文字起こしツールは無料ですか?
ログイン済みのアカウントなら毎日 3 回、各 10 分まで無料で、すべての書き出し形式が使えます。有料プランは 1 日の上限がなくなり、1 ファイル 30 分まで、分数に応じてクレジットを消費します。レートは料金ページをご覧ください。
アカウントは必要ですか?
必要です。書き起こしは音声とともに履歴に保存され、あとで戻れます。無料枠はアカウント単位で数えます。
対応言語は?
広く話されている言語のほとんどの録音を、その言語のまま文字起こしします。言語は自動検出され、設定は不要です。
話者を区別しますか?
はい。各発言は話者に割り当てられ、話者 1、話者 2 を本名に変更できます。一人だけの録音ではラベルは表示されません。
対応フォーマットと長さは?
MP3、WAV、M4A、OGG。1 ファイルあたり最大 50 MB、最長 30 分。書き出しはプレーンテキスト、タイムスタンプ付きテキスト、SRT、VTT です。
精度はどのくらいですか?
一人か二人のクリアな録音なら、注意深く聴いた人が書き取るものに近い精度です。背景ノイズ、遠いマイク、重なった会話で下がります。先に音声をクリーンにするのが何より効き、後で名前を検索すれば残りの大半が拾えます。
動画を文字起こしできますか?
まだ直接はできません。動画から音声トラックを MP3 か WAV で書き出してアップロードし、SRT の書き出しで動画に字幕を付けてください。
スマートフォンの音声入力と同じですか?
違います。スマートフォンの音声入力は話している間に打ち、ライブでしか使えません。ここでは手元の録音を、タイムスタンプと話者ラベル付きで文字起こしし、どの行でもクリックして聴けます。
09—読み返す
書き起こしは台本になる
言葉がページに載ったら、AnyVoice の他のツールがもう一度それを話せます。