文字起こしに渡す音声ファイルでつまずく3か所|対応形式・25MBの壁・分割の切り方

文字起こしに渡す音声ファイルの制約を整理した記事のアイキャッチ 仕事でAI活用

録音した音声ファイルをOpenAIの音声文字起こしAPIに渡すと、エラーだけが返り、理由が表示されないことがあります。原因は、対応形式・ファイルサイズ・分割の仕方の3つのどれかです。

この記事は、OpenAIの音声文字起こしAPI(Speech-to-Text API)の仕様だけを扱います。確認できたのは公式ページの範囲だけで、他社サービス(Notta・CLOVA Noteなど)は扱いません。

結論:OpenAIの音声文字起こしAPIで止まる原因は3つです

公式ページの制約を並べました。

原因 内容 対策
① 対応形式 拡張子が公式の7つに入っているか未確認 7つのいずれかに変換して渡す
② 25MBの壁 ファイルが25MBを超えている 圧縮するか分割する
③ 分割の切り方 分割位置が文の途中になっている 文の途中で切らずに分割する(公式)

この記事の根拠

当社は2026-09-11に、OpenAIの公式ドキュメント(developers.openai.com/api/docs/guides/speech-to-text)で以下を確認しました。

項目 結果 確認日
対応入力形式 mp3・mp4・mpeg・mpga・m4a・wav・webmの7つ 2026-09-11
ファイルサイズの上限 25MBまで(超過時は結論表③) 2026-09-11
モデルの使い分け 文字起こしはgpt-transcribe(推奨)、話者識別はgpt-4o-transcribe-diarize、タイムスタンプ・字幕・翻訳はwhisper-1 2026-09-11

① 対応形式 — 使える拡張子は7つ

対応形式とは、このAPIが読み込める音声ファイルの拡張子です。

公式の7つは、mp3・mp4・mpeg・mpga・m4a・wav・webmです。ogg・flac・aiffなど、ここに無い形式は公式ページで確認できませんでした。

拡張子 よく使われる場面
m4a・mp3・wav スマホのボイスメモ、ICレコーダー
webm ブラウザの録音・録画機能
mp4・mpeg・mpga 動画の音声トラックなど

② 25MBの壁 — ファイルサイズの上限

25MBの壁とは、このAPIが受け付けるファイルサイズの上限です。

公式ページは「25MBまで」で、対応形式でも超えるファイルはそのままでは渡せません。長時間録音で当たりやすい壁です。

1時間の録音はおよそ何MBか(当社の試算)

64kbpsなら1時間=3600秒×64kbit÷8÷1000=およそ28.8MB、128kbpsならおよそ57.6MBです。公式ページに記載はなく、当社の計算です。

実際のサイズは設定で変わるため、端末で確認してください。

③ 分割の切り方 — 文の途中を避ける

分割の切り方とは、25MBを超えるファイルを分けるときの切る場所の決め方です。

公式の案内は、圧縮するか25MB以下に分割し、文の途中で分割しないことです(文脈が失われ精度が落ちるため。ここまでが公式)。

無音の区間(発言の間、話題の変わり目)を目安にすると、この注意に沿いやすくなります(当社の補足。公式に無音の記載はなし)。

分割するときのチェックリスト

  • 1つずつのファイルが25MB以下になっているか
  • 切った場所が無音の区間か(当社の目安)
  • 分割後のファイル名に順番が分かる番号を付けたか
  • 分割後、7つの対応形式のいずれかで保存されているか

録音時間の長さ別、次にやること

録音時間の長さで、確認すべき順番が変わります。

録音の状態 まずやること
30分程度、1本の録音で終わる人 拡張子に加えサイズも確認を(128kbpsなら30分で約28.8MB、25MB超あり)
1〜2時間の長時間録音がある人 渡す前にサイズを確認し、超えていれば分割します
録音アプリの仕様で、もともと複数ファイルに分かれている人 無理に結合せず、分かれたまま渡します(文の途中で切れている場合は③の注意)

この記事の内容を確認しなくてよい場合

ここまでの3つは、いずれもファイルを渡す前に決まってしまう条件です。次のどちらかに当てはまる方は、確認せずにそのまま渡して構いません。

  • スマートフォンやパソコンの画面から使う文字起こしサービスに、ファイルをそのままドラッグして渡している方:形式の変換や分割は、サービス側が先に済ませている場合があります。エラーが出たときにこの記事へ戻ってください。
  • 録音が10分以内で、iPhoneのボイスメモ(m4a)やパソコンの標準録音(wav)を使っている方:形式は公式の7つに入っており、サイズも25MBに届かない見込みです。ただし高音質設定で録った場合は容量が増えるため、渡す前にファイルの大きさだけ見ておくと確実です。

逆に、会議やインタビューを1時間以上まとめて録っている方は、この記事の②と③がそのまま必要になります。

よくある質問

ここでは、OpenAIの音声文字起こしAPIにファイルを渡すときに読者から実際に出やすい疑問を、公式ページで確認できた範囲だけで お答えします。

m4aのファイルは文字起こしできますか

できます。公式の7形式の1つがm4aです(2026-09-11確認)。iPhoneのボイスメモはこの形式です。

ogg・flacなど、対応形式に無い拡張子のファイルはどうすればよいですか

この7形式以外は公式ページで確認できませんでした。対応形式に変換してから渡してください。

動画ファイルのままでも渡せますか

公式が挙げている7つの形式には、mp4とwebmが含まれています(2026-09-11確認)。ただし動画は音声だけの形式より容量が大きくなりやすく、25MBの上限に先に当たることがあります。音声だけを取り出してから渡すほうが、分割の手間は減ります(ここは当社の補足です)。

25MBぎりぎりのファイルは渡してよいですか

公式表記は「Files can be up to 25 MB.」で、25MBちょうどを含むかは未確認です。余裕を持って圧縮か分割をおすすめします。

モデルによって対応形式は変わりますか

モデルごとに対応形式やサイズ上限が変わるという記述は、今回確認した公式ページでは見当たりませんでした(2026-09-11確認)。用途別にgpt-transcribe(推奨)、gpt-4o-transcribe-diarize(話者識別)、whisper-1(タイムスタンプ等)が案内されています。

まとめ

この記事で扱ったのは、OpenAIの音声文字起こしAPIにファイルを渡す前に決まってしまう3つの条件です。

  • OpenAIの音声文字起こしAPIの対応形式は、mp3・mp4・mpeg・mpga・m4a・wav・webmの7つです(2026-09-11確認)。
  • OpenAIの音声文字起こしAPIのファイルサイズ上限は25MBで、超えると渡せません。
  • OpenAIの音声文字起こしAPIで25MBを超える場合は、圧縮か分割で対応します。公式の注意は「文の途中で切らない」までで、無音の区間の目安は当社の補足です。
  • 1時間あたりの目安(28.8MB・57.6MBなど)は当社のビットレート試算で、公式の数値ではありません。
  • 精度を決める要因は範囲外です。別記事で方法論として扱っています。

出典

精度が何で決まるかは文字起こしの「精度」は何で決まるか|比較記事の数字を疑うで、録音機器選びはAIボイスレコーダーは結局どれを買えばいいか|場面別に、公式データだけで答えるでまとめています。

コメント

タイトルとURLをコピーしました