Skip to content

OpenAI の新しいリアルタイム API: ついに人間と話せる AI

誰もが経験したことがあるでしょう。急いで会社のカスタマー サービスに電話すると、完璧に明瞭だが魂の抜けた声が聞こえてきます。「サービスに関するお問い合わせの場合は、1 を押してください。人間の代表者の方は、0 を押してください...」その後、しばしば延々と続く保留音が続き、「ごめんなさい、理解できませんでした。もう一度言ってください。」という腹立たしいほど穏やかな声が続きます。しかし、OpenAI からの最近の発表では、リアルタイム API 音声モデルの完全なスイートが公開され、このもどかしい時代が終わりに近づいている可能性があることが示唆されています。彼らのデモに基づいて、彼らは機械に人間のように話し、動作させることを真剣に試みています。

 

OpenAI の新しいリアルタイム API: ついに人間と話せる AI

 

人間のようなペルソナが外装だとすれば、その根底にある推論能力が核となります。このリリースの主役は間違いなく GPT-Realtime-2 です。ベンチマーク結果では、前世代よりも Big Bench Audio で 15.2%、Audio MultiChallenge で 13.8% 優れたパフォーマンスを示しています。 Zillow の内部敵対的テストでは、複雑な呼び出しの成功率が 69% から 95% という驚異的な 26 パーセントポイントに上昇しました。

 

OpenAI の新しいリアルタイム API: ついに人間と話せる AI

 

以前の音声アシスタントは、単純な線形ロジックで動作していました。 「曲をかけて」と言うと、曲が流れます。 「電気を消して」と言うと電気が消えます。しかし、一度に 3 つのタスクを与えて、気が変わったことが 2 回あると、クラッシュする可能性があります。 GPT-Realtime-2 は、OpenAI が GPT-5 レベルの推論を音声モデルに直接統合しており、GPT-5 が自然な会話形式で話しているような印象を与えるため、異なります。

実際の例を考えてみましょう。あなたは車を運転していて、アシスタントに「地下鉄の駅の近くのアパートを探して、家賃を安くして、幹線道路を避けて、できれば土曜日の午後にエージェントとの内見を予約してください。」と伝えます。これは単純な音声認識をはるかに超えています。複数の制約を理解し、場所をフィルタリングし、価格を比較し、エージェントのスケジュールを相互参照する必要があります。このような複雑なタスクを処理するために、OpenAI は 2 つの特別なスキルを備えています。

1つ目は「並列ツール呼び出し」です。このモデルは複数のスレッドで動作できるようになり、会話しながら地図、カレンダー、レンタル アプリに同時にアクセスできるようになりました。バックグラウンドでタイプしているのが聞こえる有能な人間のアシスタントのように、「カレンダーをチェックしているところです...」または「近くのリストを探しています...」とつぶやいているのが聞こえるかもしれません。これは、おそらく最も人間らしい 2 番目のアップデート「Preambles」につながります。人間は、複雑なリクエストを考えたり処理したりする時間が必要なとき、「えー、考えさせてください」や「ちょっと待ってください、それを調べています」などのつなぎ言葉を使います。 AIはこのトリックを学習しました。データを取得している間、自然に「わかりました、問題ありません。それを確認するために少し時間をください。」などと言うでしょう。この一見小さな追加により、応答を待つ不安が大幅に軽減されます。

 

OpenAI の新しいリアルタイム API: ついに人間と話せる AI

 

GPT-Realtime-2 に加えて、もう 1 つの傑出したものは GPT-Realtime-Translate です。現在の翻訳アプリのほとんどはターン制です。あなたが話し、待つと、機械が翻訳を読み上げます。これは道を尋ねるのには問題ありませんが、ビジネス会議では気まずい間が生じてしまいます。 GPT-Realtime-Translate は 70 以上の入力言語をサポートし、ほぼ同時の翻訳を提供します。アクセントにも驚くほど寛容です。インドの企業 BolnaAI は、ヒンディー語のアクセントが強いこの製品をテストしたところ、その精度が他の製品をはるかに上回っていることがわかりました。これにより、字幕なしの国際的なチュートリアルやライブ イベントのリアルタイム翻訳などの可能性が広がります。

超低遅延の音声テキスト変換用に新しくリリースされた GPT-Realtime-Whisper と組み合わせることで、ソフトウェア インタラクション モデル全体が変化しています。会議では、上司が話している間に、画面に適切に構造化された概要がリアルタイムで表示される可能性があります。価格については、GPT-Realtime-Whisper は 0.017 ドル/分、GPT-Realtime-Translate は 0.034 ドル/分、GPT-Realtime-2 はトークンベースで、音声入力が 32 ドル/100 万ドル、音声出力が 64 ドル/100 万ドルです。傾向は明らかです。音声は、不器用なアドオンから、デジタル世界を制御するための最も自然なインターフェイスへと進化しています。結局のところ、話すことは私たちの最も生得的なスキルです。

 

OpenAI の新しいリアルタイム API: ついに人間と話せる AI

 

技術進歩の目標は常に、複雑さを隠し、最もシンプルで最も直観的なインターフェースをユーザーに提示することでした。おそらく近い将来、必要なのはイヤホンと自分の声だけで、仕事や生活のあらゆる側面を管理できるようになるでしょう。しかし、これは痛切な疑問を引き起こします。感情が常に安定し、人間のあらゆるニュアンスを理解してくれる AI に私たちが慣れてしまったら、人間間の非効率で誤解されがちなコミュニケーションにも忍耐力が持てるでしょうか?

_{area}

_{region}
_{language}