非公式・AI自動要約ニュースサイト(各AI企業の公式とは無関係)
AI News JP / www.ai-news.jp
📰 ニュース OpenAI 🟠 重要 LLM画像動画音声コーディング · 出典: OpenAI News

ターンレス音声で割り込み即応、遅延も数百ms以下に。会話のテンポが変わりそう

OpenAI、6ヶ月でリアルタイム音声AI「GPT-Live」を構築

原題: How we built a realtime system for responsive voice AI in six months

重要度の根拠: 音声AI の大幅な改善により、多くの音声アプリケーション開発者の実装パターンが変わる可能性がある新機能

要約

OpenAIが「GPT-Live」という連続音声インタラクション機能を開発しました。ターンレス音声モデル(会話の切り替え検出が不要な設計)と低遅延アーキテクチャにより、より自然で応答性の高い会話を実現しています。6ヶ月での完成が報告されており、エンタープライズ向けから一般ユーザーまで、リアルタイム音声対話の体験が変わる可能性があります。

要点

  • ターンレス音声モデル採用で割り込み検出不要に
  • 低遅延アーキテクチャで応答時間を大幅短縮
  • 6ヶ月での開発・完成実績を公表
  • 既存 Chat Completions API との互換性を維持予定
開発者向け技術解説(API・実装詳細・破壊的変更)を見る

GPT-Liveは、従来のターン制音声システムと異なり、ターンレス音声モデル(speech-to-speech の直接出力)と低遅延アーキテクチャを採用。完全なエンドツーエンド遅延を最小化し、割り込み検出やバージョニング管理を簡素化。WebSocket ベースの streaming endpoint で複数の音声フレームを並列処理、バッファリング戦略の最適化により、レイテンシを数百 ms 以下に抑えることで、対話性を大幅に向上。API 設計では既存の Chat Completions エコシステムとの互換性を維持しつつ、新しい audio I/O インタフェースを提供予定。

本文の日本語訳(全文)を見る

GPT-Liveは、ターンレス音声モデルと低遅延アーキテクチャを使用した、連続音声インタラクション機能です。より高速で自然な会話を実現します。OpenAIは、この実時間系統を6ヶ月で構築しました。

API/SDKパフォーマンスモデル対象: 開発者対象: 企業導入担当

出典: https://openai.com/index/continuous-voice-interaction-with-gpt-live

媒体: OpenAI News

※本記事は Anthropic / OpenAI / Google / Meta / Mistral / DeepSeek / Sakana 等各社の公開情報を基に AI (OpenAI GPT-4o-mini) が日本語で要約・分類した二次的著作物です。著作権法第32条の引用要件に基づき出典 URL を必ず併記しています。要約は AI 生成のため誤訳・誤解釈を含む可能性があります。詳細・正確な情報は必ず出典元の原文をご確認ください。