録音した音声ファイルをOpenAIの音声文字起こしAPIに渡すと、エラーだけが返り、理由が表示されないことがあります。原因は、対応形式・ファイルサイズ・分割の仕方の3つのどれかです。
この記事は、OpenAIの音声文字起こしAPI(Speech-to-Text API)の仕様だけを扱います。確認できたのは公式ページの範囲だけで、他社サービス(Notta・CLOVA Noteなど)は扱いません。
結論:OpenAIの音声文字起こしAPIで止まる原因は3つです
公式ページの制約を並べました。
| 原因 | 内容 | 対策 |
|---|---|---|
| ① 対応形式 | 拡張子が公式の7つに入っているか未確認 | 7つのいずれかに変換して渡す |
| ② 25MBの壁 | ファイルが25MBを超えている | 圧縮するか分割する |
| ③ 分割の切り方 | 分割位置が文の途中になっている | 文の途中で切らずに分割する(公式) |
この記事の根拠
当社は2026-09-11に、OpenAIの公式ドキュメント(developers.openai.com/api/docs/guides/speech-to-text)で以下を確認しました。
| 項目 | 結果 | 確認日 |
|---|---|---|
| 対応入力形式 | mp3・mp4・mpeg・mpga・m4a・wav・webmの7つ | 2026-09-11 |
| ファイルサイズの上限 | 25MBまで(超過時は結論表③) | 2026-09-11 |
| モデルの使い分け | 文字起こしはgpt-transcribe(推奨)、話者識別はgpt-4o-transcribe-diarize、タイムスタンプ・字幕・翻訳はwhisper-1 | 2026-09-11 |
① 対応形式 — 使える拡張子は7つ
対応形式とは、このAPIが読み込める音声ファイルの拡張子です。
公式の7つは、mp3・mp4・mpeg・mpga・m4a・wav・webmです。ogg・flac・aiffなど、ここに無い形式は公式ページで確認できませんでした。
| 拡張子 | よく使われる場面 |
|---|---|
| m4a・mp3・wav | スマホのボイスメモ、ICレコーダー |
| webm | ブラウザの録音・録画機能 |
| mp4・mpeg・mpga | 動画の音声トラックなど |
② 25MBの壁 — ファイルサイズの上限
25MBの壁とは、このAPIが受け付けるファイルサイズの上限です。
公式ページは「25MBまで」で、対応形式でも超えるファイルはそのままでは渡せません。長時間録音で当たりやすい壁です。
1時間の録音はおよそ何MBか(当社の試算)
64kbpsなら1時間=3600秒×64kbit÷8÷1000=およそ28.8MB、128kbpsならおよそ57.6MBです。公式ページに記載はなく、当社の計算です。
実際のサイズは設定で変わるため、端末で確認してください。
③ 分割の切り方 — 文の途中を避ける
分割の切り方とは、25MBを超えるファイルを分けるときの切る場所の決め方です。
公式の案内は、圧縮するか25MB以下に分割し、文の途中で分割しないことです(文脈が失われ精度が落ちるため。ここまでが公式)。
無音の区間(発言の間、話題の変わり目)を目安にすると、この注意に沿いやすくなります(当社の補足。公式に無音の記載はなし)。
分割するときのチェックリスト
- 1つずつのファイルが25MB以下になっているか
- 切った場所が無音の区間か(当社の目安)
- 分割後のファイル名に順番が分かる番号を付けたか
- 分割後、7つの対応形式のいずれかで保存されているか
録音時間の長さ別、次にやること
録音時間の長さで、確認すべき順番が変わります。
| 録音の状態 | まずやること |
|---|---|
| 30分程度、1本の録音で終わる人 | 拡張子に加えサイズも確認を(128kbpsなら30分で約28.8MB、25MB超あり) |
| 1〜2時間の長時間録音がある人 | 渡す前にサイズを確認し、超えていれば分割します |
| 録音アプリの仕様で、もともと複数ファイルに分かれている人 | 無理に結合せず、分かれたまま渡します(文の途中で切れている場合は③の注意) |
この記事の内容を確認しなくてよい場合
ここまでの3つは、いずれもファイルを渡す前に決まってしまう条件です。次のどちらかに当てはまる方は、確認せずにそのまま渡して構いません。
- スマートフォンやパソコンの画面から使う文字起こしサービスに、ファイルをそのままドラッグして渡している方:形式の変換や分割は、サービス側が先に済ませている場合があります。エラーが出たときにこの記事へ戻ってください。
- 録音が10分以内で、iPhoneのボイスメモ(m4a)やパソコンの標準録音(wav)を使っている方:形式は公式の7つに入っており、サイズも25MBに届かない見込みです。ただし高音質設定で録った場合は容量が増えるため、渡す前にファイルの大きさだけ見ておくと確実です。
逆に、会議やインタビューを1時間以上まとめて録っている方は、この記事の②と③がそのまま必要になります。
よくある質問
ここでは、OpenAIの音声文字起こしAPIにファイルを渡すときに読者から実際に出やすい疑問を、公式ページで確認できた範囲だけで お答えします。
m4aのファイルは文字起こしできますか
できます。公式の7形式の1つがm4aです(2026-09-11確認)。iPhoneのボイスメモはこの形式です。
ogg・flacなど、対応形式に無い拡張子のファイルはどうすればよいですか
この7形式以外は公式ページで確認できませんでした。対応形式に変換してから渡してください。
動画ファイルのままでも渡せますか
公式が挙げている7つの形式には、mp4とwebmが含まれています(2026-09-11確認)。ただし動画は音声だけの形式より容量が大きくなりやすく、25MBの上限に先に当たることがあります。音声だけを取り出してから渡すほうが、分割の手間は減ります(ここは当社の補足です)。
25MBぎりぎりのファイルは渡してよいですか
公式表記は「Files can be up to 25 MB.」で、25MBちょうどを含むかは未確認です。余裕を持って圧縮か分割をおすすめします。
モデルによって対応形式は変わりますか
モデルごとに対応形式やサイズ上限が変わるという記述は、今回確認した公式ページでは見当たりませんでした(2026-09-11確認)。用途別にgpt-transcribe(推奨)、gpt-4o-transcribe-diarize(話者識別)、whisper-1(タイムスタンプ等)が案内されています。
まとめ
この記事で扱ったのは、OpenAIの音声文字起こしAPIにファイルを渡す前に決まってしまう3つの条件です。
- OpenAIの音声文字起こしAPIの対応形式は、mp3・mp4・mpeg・mpga・m4a・wav・webmの7つです(2026-09-11確認)。
- OpenAIの音声文字起こしAPIのファイルサイズ上限は25MBで、超えると渡せません。
- OpenAIの音声文字起こしAPIで25MBを超える場合は、圧縮か分割で対応します。公式の注意は「文の途中で切らない」までで、無音の区間の目安は当社の補足です。
- 1時間あたりの目安(28.8MB・57.6MBなど)は当社のビットレート試算で、公式の数値ではありません。
- 精度を決める要因は範囲外です。別記事で方法論として扱っています。
出典
- OpenAI Platform Docs「Speech to text」(確認日:2026-09-11)
精度が何で決まるかは文字起こしの「精度」は何で決まるか|比較記事の数字を疑うで、録音機器選びはAIボイスレコーダーは結局どれを買えばいいか|場面別に、公式データだけで答えるでまとめています。


コメント