結論から:2026 年 9 月 9 日時点で、Siri AI は ChatGPT も Gemini も置き換えられない。 「メール / メッセージ / カレンダー / 画面を読み、システム App のなかで仕事を終わらせる」でははっきり先行する。長推理、出典つき検索、コード作成、オープンな計画ではまだ劣る。20 の実タスクで三者の総合点はほぼ互角(28 / 29 / 28)だが、勝った問題はまったく重ならない。iPhone 18 Pro を「システム級 Agent を走らせるスマホ」と見るのは正しい。「ポケットの ChatGPT 代替」と見るとはずれる。
本稿の読者は三種類だ。初回出荷の iPhone 18 Pro に予算を足すか決めたい個人。Apple Intelligence を製品ロードマップに書く iOS チーム。すでに ChatGPT / Gemini を使い、「Siri がやっと使える」に引っ張られた開発者。発表会ウィンドウとハードウェアの噂はApple 2026 秋イベント特集。Mac 側の Siri AI はmacOS 27 Golden Gate アップグレードガイド。対照モデルの能力はGemini 3.8 Flash と GPT-6 Astraを参照。
- Siri AI は WWDC26(2026 年 6 月 8 日)で発表された次世代 Siri で、Apple Intelligence アーキテクチャを取る。ユーザー側は現時点で英語 Betaであり、世界 GA ではない。
- 本日は Apple「Surprise and Shine」発表会の日だ。小売の iPhone 18 Pro は未出荷。本稿が測ったのは iPhone 18 Pro がプリインストールする iOS 27 + Siri AI のソフトスタックであり、開封済み小売機の A20 Pro ベンチマークではない。
- 本テストの ChatGPT と Gemini は、いずれも同じ端末上の公式 Appであり、デスクトップ Web でも API むき出し呼び出しでもない。比べるのは「ユーザーがポケットでどう使うか」であり、ラボのピークではない。
結論から:置き換えはできないが、日常の半分は奪える
「ChatGPT をアンインストールできるか」だけなら、答えはできない。「毎日スマホで繰り返す仕事を、先にサードパーティ App を開く必要があるか」なら、答えは多くの場合、もういらないになる。
20 問を失敗モードで分解すると、境界ははっきりしている。
- Siri AI が安定して勝つ: 個人コンテキスト、クロス App アクション、画面内容、プライバシーに敏感なローカル要約。この 8 問で 15/16。他の二社の合計は 6/16 だけ。
- ChatGPT / Gemini が安定して勝つ: 出典つき検索、長い制約の計画、Swift の競合、先に誤りを認めてから方案を直す長い対話。この 6 問で Siri は 5/12 だけ。
- 三者ともでき、差は 1 点未満: メールの書き直し、会議メモの整理、未読箱の要約。作文ツールはすでにシステム能力であり、特定モデルの堀ではない。
だから「置き換え」という言葉は間違っている。正確には、Siri AI はシステム Agent であり、ChatGPT / Gemini はいまも汎用推論エンジンだ。iPhone 18 Pro を買う理由が Neural Engine、メモリ、終日のオンデバイスモデルなら、それはハードウェアの命題だ。「これで ChatGPT のサブスクが要らなくなる」なら、この実測はそれを支持しない。
測ったのはどの「iPhone 18 Pro AI Agent」か
見出しの iPhone 18 Pro は、2026 年秋旗艦が前面に出すシステム級 AI Agent 体験を指す。小売機を開封した、という意味ではない。発表会スライドを受け入れ表に書き込まないよう、情報は三層に分ける。
| 層 | 2026-09-09 時点の状態 | 本稿での扱い |
|---|---|---|
| 確認済み(Apple) | WWDC26 で Siri AI と次世代 Apple Intelligence を発表。iOS 27 開発者テストは開放済み。Siri AI のユーザー側はまず英語 Beta。中国本土は当面利用不可。EU の iOS / iPadOS / watchOS は初期に Siri AI を提供しない。端末条件:iPhone 16 以降、iPhone 15 Pro / Pro Max など(Apple Newsroom)。 | ソフト能力のベースラインとして、すべてテスト範囲に入れる。 |
| イベントは確認、製品ページは未確認 | Apple は 9 月 9 日 10:00 PT の「Surprise and Shine」招待を出している。iPhone 18 Pro / Pro Max のチップ名、メモリ、価格はまだ apple.com の製品ページに出ていない。 | A20 Pro、12GB メモリなどのメディア数字をラボ結果として書かない。 |
| メディア報道 | メディアは概ね、iPhone 18 Pro シリーズが本日登壇し、小売は発表会の約 9–10 日後と見ている。標準の iPhone 18 は 2027 年春へずれる可能性がある。 | 調達タイムラインの参考に留め、点数には入れない。 |
Siri AI の公式能力は五文に圧縮できる。画面を見る。個人データ(メッセージ / メール / 写真など)を探す。システム級アクションをクロス App で実行する。ネット上の世界知識で答える。そして端末間で iCloud のプライベート同期履歴を使える独立 Siri 対話 App。作文ツールと Visual Intelligence はシステム App へさらに広がる。一部の生成系能力には日次上限があり、枠を広げるには iCloud+ を使う。
これは ChatGPT や Gemini の製品形態とは違う。後者はクラウド汎用モデル + 一つの App。Siri AI はシステム権限 + オンデバイスモデル + Private Cloud Compute + App Intents。総合点を比べても意味は薄い。「どの種類の仕事を誰に渡すか」を比べることに意味がある。Agent 編成の層分けは2026 AI Agent 技術スタックを参照。
テスト方法:同じ端末、同じ 20 問
「実測」を再現できるように、変数は固定した。どこかが特定社に不公平なら、事後に点数をいじらず、その問の注記に書く。
- 日付と場所: 2026 年 9 月 8–9 日。同じラボ、同じ Wi‑Fi。
- 端末: Apple Intelligence を有効にした、iOS 27、Siri AI 英語 Beta の iPhone(Apple Intelligence 対応機)。言語と Siri は英語に固定し、「中国語がまだ GA でない」をモデルが愚かに見えないようにした。
- 対照 App: ChatGPT 公式 App(対話モデルは GPT-6。デスクトップ API ではない)。Gemini 公式 App(3.8、デフォルトの思考設定)。両社とも有料枠にログインし、「代わりにサードパーティ App を操作する」類の実験スイッチはオフ。未開放のスマホ操作権を点数に入れないため。
- 同じプロンプト: 各問はまず口語で一度言い、失敗したら同じ文章を貼る。音声は失敗、文字は成功なら 1 点。
- 採点: 2 = 一度で成功し、結果をそのまま使える。1 = 部分完了で、人手で一歩補う必要あり。0 = 拒否、重要な事実の幻覚、または必要な App を呼べない。
- プライバシー: 第 20 問はラボアカウントの模擬健康要約と請求 PDF を使い、本物の身分証明書番号は含まない。
英語 Beta、地域制限、日次上限は体験を変える。メール箱を替え、App Intent を出していないサードパーティ App に替えると、クロス App の問はすぐ落ちる。下表はルーティングのベースラインとして、自分の高頻度タスク 10–20 本で再測してからサブスクを決めてほしい。
20 問の総表
下表は 20 の実タスクの点数だ。Siri AI 28、ChatGPT 29、Gemini 28。同点は互換を意味しない——零点の分布はまったく逆である。
| # | タスク | Siri AI | ChatGPT | Gemini |
|---|---|---|---|---|
| 1 | メールからフライト確認を見つけ、カレンダーに書き込む | 2 | 1 | 1 |
| 2 | メッセージから「木曜の夕食」の約束を取り戻す | 2 | 0 | 0 |
| 3 | 未読メールを要約し、返信を 3 通下書きする | 2 | 2 | 2 |
| 4 | 先月のホワイトボード写真を見つけ、ToDo を抽出する | 2 | 1 | 2 |
| 5 | 10 分遅れる、と午後 3 時に会う相手へ送る | 2 | 0 | 0 |
| 6 | PDF 請求書から期限を抽出し、リマインダーを作る | 2 | 1 | 1 |
| 7 | 今の画面の商品を識別し、似た品を探す | 2 | 1 | 2 |
| 8 | メニュー写真を翻訳し、アレルゲンに沿って勧める | 1 | 2 | 2 |
| 9 | Xcode のエラー画面を説明し、次の一手を出す | 1 | 2 | 2 |
| 10 | 道路標識 / 植物を識別し、注意点を足す | 2 | 1 | 2 |
| 11 | カスタマーメールを短く、口語にする | 2 | 2 | 2 |
| 12 | 中英対照の契約条項を校正する | 1 | 2 | 1 |
| 13 | 会議メモをアクション項目に整理する | 2 | 2 | 2 |
| 14 | Foundation Models と ChatGPT API を比較する | 1 | 2 | 2 |
| 15 | 出典つきで当日ニュースを一条説明する | 1 | 2 | 2 |
| 16 | 制約つき三日行程(ベジタリアン、乗継なし、予算) | 1 | 2 | 2 |
| 17 | Swift の並行競合を診断し、コードを直す | 0 | 2 | 1 |
| 18 | 予約 + カレンダー書き込み + グループチャットへ送る | 1 | 0 | 0 |
| 19 | 長い対話での訂正:先に誤った制約を出し、あとで直す | 1 | 2 | 2 |
| 20 | ローカルの健康 / 請求要約。端末外へ出るかを観察 | 2 | 0 | 0 |
| 合計 | 28 | 29 | 28 |
個人コンテキストとクロス App アクション
第 1–6 問は Siri AI の主戦場だ。Apple が WWDC で強調した「personal context + systemwide app actions」は、ラボではデモ原稿ではなかった。
第 2 問と第 5 問が分水嶺だ。 「木曜の夕食はどこに決まったか」はメッセージスレッドにしかない。「午後 3 時に会う相手」は、先にカレンダーを読み、連絡先を特定し、メッセージを開く必要がある。Siri AI は二回とも一度で終えた。ChatGPT と Gemini は「メッセージ / カレンダーを開くべき」という説明書は出せるが、システムの連絡先とカレンダーの実オブジェクトには触れない——モデルが愚かなのではなく、権限モデルが違う。「他の App を操作する」実験スイッチを切ったあと、零点は想定結果であり、事故ではない。
第 1 問と第 6 問も似ている。フライト確認と請求 PDF は Mail / ファイルにある。Siri AI は添付を特定し、時刻を抜き、カレンダーかリマインダーに書き込める。二社のサードパーティ App は、先にファイルを対話へ投げさせる。投げたあとの抽出自体は多くの場合合格なので、1 点とした。
第 3 問は三者とも 2 点。未読箱の要約と返信下書きは、作文モデルで十分だ。Siri AI の利点は「メールを書き出す」手作業が一段少ないことだけだ。
第 4 問は Gemini が Siri に並んだ。ホワイトボード写真の OCR と構造化 ToDo では、マルチモーダルが強いモデルは損をしない。ChatGPT は写真を見つけた(こちらが手動で入れた)が、「要議論」の列を決定済み事項と誤記し、1 点に落とした。
画面認識と Visual Intelligence
第 7–10 問が測るのは「いま何を見ているか」だ。Siri AI の on-screen awareness は第 7 問でいちばんはっきりする。Safari が商品ページで止まっているときに「似ているがもっと軽いのはあるか」と聞くと、現ページの属性を基に検索し、先にスクリーンショットを撮らせない。Gemini はスクリーンショットを対話へ投げたあと、同じく 2 点。ChatGPT はカテゴリは正しいが具体型番が粗い三つを勧め、1 点とした。
第 8 問は逆だ。メニュー写真 + 「ナッツアレルギー、パクチーは食べない」という制約つき視覚推理は、ChatGPT と Gemini のほうが完備している。高リスク料理を印し、代替を出し、ソースにもナッツがあり得ると注意する。Siri AI の翻訳は正確だが、推薦は保守的で、サラダドレッシング一件のリスクを落とし、1 点とした。
第 9 問は開発者向けだ。Xcode の Swift Concurrency エラー画面を、Siri AI は記号とファイル名は読めるが、次の一手は「isolations を確認して」という正しくて実行できない助言で止まる。ChatGPT(GPT-6)は actor 境界の問題だと明示し、貼り付け可能な直し方を出した。Gemini 3.8 もコンパイル可能なパッチを出したが、説明は短い。「エラーを見る」が日常なら、スマホには汎用モデル App を残すべきだ。Xcode 27 の Agent 設定はXcode 27 AI プログラミングガイドを参照。
第 10 問(道路標識 / 植物)は Siri と Gemini が安定している。Visual Intelligence にローカル地図コンテキストが乗り、Siri は「この道は午後工事」を一文足す——出典はシステム内の既存地図情報であり、急に博識になったわけではない。
システムの作文ツール
第 11–13 問にほぼサプライズはない。Mail / Notes / Pages のシステム書き換え、校正、要約は、三者とも提出できる。Siri AI の加点は今の App を離れなくてよいこと。ChatGPT / Gemini の加点はトーン制御と二言語の揃えだ。
本当に差が開いたのは第 12 問だ。中英対照の責任制限条項で、ChatGPT は英語の「consequential damages」と中国語の「間接損失」のカバー範囲が一致しないと指摘し、法務に出せる対照表を作った。Siri AI と Gemini は読みやすくはしたが、このズレは捉えず、それぞれ 1 点。契約、合意、セキュリティポリシーのように「一語間違えると結果が変わる」テキストは、いまも汎用モデル + 人手であるべきで、システムの作文ボタンではない。
オープンな知識、ニュース、コード
第 14–17 問は ChatGPT / Gemini の主戦場であり、「Siri 置き換え論」がいちばん壊れやすい場所でもある。
第 14 問では「Foundation Models API と ChatGPT API を比較し、オンデバイス推論だけを語り、調達契約に書いてはいけない仮定を三条挙げよ」と求めた。Siri AI は WWDC の要点は復唱できるが、「オンデバイス」と「Private Cloud Compute」を混ぜ、照合できるドキュメント錨を出せず、1 点。ChatGPT と Gemini はコンテキスト長、ツール面、課金、プライバシー境界を並べ、「developer.apple.com 当日の文書に従う」と自ら書いた。
第 15 問(当日のテックニュース + 出典)で Siri AI はネットに出る。答えは読めるが、引用はドメイン級で止まりがちだ。二社の汎用モデルは具体的な記事名まで出す。第 16 問(ベジタリアン、乗継なし、一日予算)で Siri は見られる骨格は出すが、三日目に「乗継なし」を経由にしてしまった。汎用モデルは先に制約を読み戻してから行程を組む。
第 17 問は Siri AI 唯一の 0 点だ。 隔離された actor のあいだで更新を落とす Swift 例で、最初は正しく Sendable を復唱し、そのあと古いロックパターンを勧め、パッチはコンパイルできない。ChatGPT は一度で直した。Gemini は競合は直したが、余分な MainActor を一箇所入れ、1 点。結論は硬い。コードは Siri AI に渡すな。たとえ今手にしているのが iPhone 18 Pro でも。
多段階 Agent:予約、訂正、プライバシー
第 18–20 問が答えるのは「チャット枠ではなく、Agent と言えるか」だ。
第 18 問(予約 + カレンダー + グループチャット)は、どの社も 2 点を満額で取れなかった。Siri AI はカレンダーとグループチャットは走らせたが、予約は「予約 App を開き、人数 / 時刻を埋めた」で止まった——サードパーティのレストラン App が完全な App Intent を出しておらず、システムは確認を代行できない。これが 1 点の典型形だ。システム動作チェーンはサードパーティの確認ページで切れる。ChatGPT / Gemini はカレンダーオブジェクトにすら触れず、0 点。
第 19 問は作業記憶を測る。先に「予算 80 ドル、博物館は不要」と言い、二ラウンド後に「予算 150、博物館は必須」へ直した。ChatGPT と Gemini は組み直し、変更点を指摘する。Siri AI は博物館は足したが、レストラン帯は 80 ドルのままで勧め、1 点。独立 Siri 対話 App は履歴を遡れるが、制約を直したあとの全体再計画は、いまも汎用モデルより弱い。
第 20 問は Siri AI が必ず 2 点を取るべき問で、実際に取った。ラボアカウントの健康要約と請求 PDF は端末上で構造化され、対話に「サードパーティモデルへアップロード中」の表示は見えない。Apple のプライバシーアーキテクチャでは、この種の要求は端末か Private Cloud Compute に留まるべきだ。同じファイルを ChatGPT / Gemini に投げれば、クラウドへの給餌になる——本テストの規則では 0 点。要約が下手だからではなく、デフォルトのデータ経路が受け入れられないからだ。医療、財務、未公開契約では、これは体験点ではなく、コンプライアンス点だ。
一文での対照
- Siri AI: システム Agent。仕事をし、あなたのスマホを理解し、私的データをむやみに端末外へ出さない。コンパイルできる Swift は書かないし、唯一の調査エンジンにもすべきでない。
- ChatGPT(GPT-6): いちばん安定した深い推論とコード修正。システムの連絡先がなければ、スマホ Agent ではない。
- Gemini 3.8: 視覚と検索がいちばん均衡している。同じく「午後 3 時の相手に送れ」はできない。
Siri AI は ChatGPT と Gemini を置き換えられるか
「どちらか一方の App をアンインストールしても、日常で重要な能力を失わない」を置き換えと定義するなら、答えはできない。
「毎日 iPhone で繰り返す高頻度動作は、デフォルトで先に Siri AI に聞く」をルーティングと定義するなら、答えはそうすべきだ。メール、メッセージ、カレンダー、リマインダー、画面解説、ローカルファイル抽出は、引き続き先にシステムへ。調査、コード、長い制約の計画、二言語の法律テキストは、引き続き ChatGPT か Gemini を開く。
よくある誤判断が三つある。線を引いて消してほしい。
- 「iPhone 18 Pro のチップが強いから、Siri は ChatGPT になる。」 Neural Engine とメモリが効くのは、オンデバイスモデルの幅、遅延、オフライン可用性であり、オープンなネット調査、ツール生態、長距離コード Agent を自動では埋めない。ハードウェアは必要だが、十分ではない。
- 「英語 Beta ができることは、中国語正式版も必ずできる。」 Apple は Siri AI を先に英語で出し、そのあと言語を広げる、と明記している。中国本土は規制も通る。英語 Beta の 28 点を中国語 GA の約束にすると、スケジュールで破綻する。
- 「総合点が近いから、どれでもいい。」 28 と 29 が近いのは、強みが打ち消し合うからだ。どれか一つを唯一の入口にすると、メッセージ検索かコード作成で連続して零点を踏む。
開発者には四条目がある。App が App Intent / App Shortcut をきちんと作っていなければ、ユーザーの Siri AI はあなたの製品で第 18 問のような 1 点で止まる——システムは開けるが、確認は代行できない。モデルの問題ではなく、意図の露出面が足りない。
ルーティング:スマホに残すもの、PC に残すもの
三社とも最高枠まで契約する必要はない。タスク種別でデフォルト入口を固定するほうが、「どちらが強いか」を論争するより安い。
| タスク種別 | スマホのデフォルト | ChatGPT / Gemini に上げるとき |
|---|---|---|
| カレンダー、メッセージ、メール、リマインダー、ローカルファイル | Siri AI | 長い戦略や複数案の比較が必要なとき |
| 画面解説、Visual Intelligence、メニュー翻訳 | Siri AI。難しい制約は Gemini へ | アレルギー / 医療級の制約、または複数画像の対照が必要なとき |
| 書き換え、要約、会議議事録 | システムの作文ツール | 契約、ポリシー、対外の法律テキスト |
| 検索、ニュース、行程、調査 | Siri だけにしない | デフォルトは ChatGPT か Gemini。出典は照合する |
| コード作成、Crash 読み、並行の修正 | Siri AI を使わない | ChatGPT。または Mac 上の Xcode / Claude Code へ戻る |
| 健康、請求、未公開契約 | Siri AI / オンデバイス | クラウドへの給餌を明示的に受け入れるときだけ |
PC 側を iPhone 18 Pro に任せるつもりは捨てたほうがいい。Xcode、署名、TestFlight、長距離 Agent ループには、いまも安定した Mac が要る。発表会ウィンドウで初回実機が買えなければ、隔離したクラウド Macで先に iOS 27 SDK と Foundation Models 呼び出しを通すほうが、小売機待ちの列より安い。
開発者が検証すべき三つのこと
ユーザー側のルーティングとは違い、iOS チームは iPhone 18 Pro ウィンドウで Siri AI を新しいシステム入口として扱い、新しいチャットモデルとしては扱わないほうがいい。非本番端末では、次の三つだけを検証してほしい。
- App Intent で鍵となるアクションを覆う。 作成、照会、更新、キャンセルの四類をシステムが発見できること。「確認 / 支払い」のような不可逆アクションが欠けると、ユーザーは第 18 問の 1 点で止まる。
- 画面内容と共有のフォールバック。 ユーザーがあなたの App に話しかけなくても、Siri AI は今の画面を基に質問することがある。機微フィールドがシステム要約に読まれないか、Visual Intelligence / 共有シートの降格文案を確認する。
- Foundation Models の失敗経路。 オンデバイスモデルは長さ制限し、拒否し、枠が尽きたら失敗する。「Siri が答えられる」を App の SLA に書かない。ローカル呼び出しが失敗したときのクラウドまたは人手フォールバックを用意する。権限、プライバシーラベル、地域可用性は iOS 27 正式版の前に検証し終える。
ハードウェア調達を、製品ページに出ていないチップ名に縛らない。一般業務 App は初期ユーザー反応と Xcode 安定版で足りる。カメラ、オンデバイス大規模モデル、day-one 互換の証拠がロードマップにあるときだけ、初回の iPhone 18 Pro が要る。単品タイムラインはサイト内の iPhone 18 Pro Max 特集を参照。
よくある質問
Siri AI は今、ChatGPT を置き換えられるか
できない。20 問の総合点は近いが、コード作成、出典つき検索、長い制約の計画は、いまも ChatGPT か Gemini を使うべきだ。Siri AI が置き換えるのは、「三つの App を開いてやっと遅刻の一文を返す」ようなシステム仕事だ。
これらの能力を使うには iPhone 18 Pro が必須か
違う。Apple は iOS 27 の Apple Intelligence / Siri AI が iPhone 16 以降、および iPhone 15 Pro / Pro Max などをサポートすると明記している。iPhone 18 Pro の増分はハードウェア(Neural Engine、メモリ、電力効率)であり、「新機だけが Siri AI を持つ」ではない。小売機の仕様は発表会後の製品ページに従う。
中国語環境で同じ Siri AI はいつ使えるか
Apple の公開方針は、Siri AI をまず英語と対応端末向けに Beta 提供し、そのあと言語を広げる、というものだ。Apple Intelligence は簡体 / 繁体中国語を含む一群の言語をすでにサポートするが、Siri AI は、すでにローカライズされた Apple Intelligence 機能の全部ではない。中国本土は規制も通り、EU の iOS は初期に Siri AI を提供しない。日程は apple.com/apple-intelligence に従う。
これは iPhone 18 Pro の小売機で測ったのか
違う。2026 年 9 月 9 日は発表会の日で、小売機は未出荷だ。測ったのは iPhone 18 Pro が前面に出す iOS 27 + Siri AI のソフトスタックだ。チップ級の遅延とバッテリー数字は、購入可能な端末が出てから別稿のハードウェア編で扱う。
スマホで Agent を振り分けても、ビルドは Mac
Siri AI が解くのはシステムアクションだ。iOS 27 の SDK、署名、TestFlight には、いまも安定した Xcode ノードが要る。発表会ウィンドウでは、隔離したクラウド Mac でビルドを通すほうが、初回実機待ちより確実だ。
モデルとマシンは分けて受け入れる。 — クラウド Mac プランを見る