Zilmac ブログ
← 技術実践に戻る

iPhone 18 Pro AI Agent実測:Siri AIはChatGPTとGeminiを置き換えられるか

Apple エコシステム ·約 16 分

ユーザーが iPhone で Siri AI と Apple Intelligence を使い、ChatGPT と Gemini のスマホ Agent 体験を対照する
28 / 40
Siri AI 総合点(20 問、各問 0–2)
29 / 40
ChatGPT(GPT-6)対照点
28 / 40
Gemini 3.8 対照点

結論から:2026 年 9 月 9 日時点で、Siri AI は ChatGPT も Gemini も置き換えられない。 「メール / メッセージ / カレンダー / 画面を読み、システム App のなかで仕事を終わらせる」でははっきり先行する。長推理、出典つき検索、コード作成、オープンな計画ではまだ劣る。20 の実タスクで三者の総合点はほぼ互角(28 / 29 / 28)だが、勝った問題はまったく重ならない。iPhone 18 Pro を「システム級 Agent を走らせるスマホ」と見るのは正しい。「ポケットの ChatGPT 代替」と見るとはずれる。

本稿の読者は三種類だ。初回出荷の iPhone 18 Pro に予算を足すか決めたい個人。Apple Intelligence を製品ロードマップに書く iOS チーム。すでに ChatGPT / Gemini を使い、「Siri がやっと使える」に引っ張られた開発者。発表会ウィンドウとハードウェアの噂はApple 2026 秋イベント特集。Mac 側の Siri AI はmacOS 27 Golden Gate アップグレードガイド。対照モデルの能力はGemini 3.8 Flash と GPT-6 Astraを参照。

先に三条だけ押さえて、それから点数を見る
  • Siri AI は WWDC26(2026 年 6 月 8 日)で発表された次世代 Siri で、Apple Intelligence アーキテクチャを取る。ユーザー側は現時点で英語 Betaであり、世界 GA ではない。
  • 本日は Apple「Surprise and Shine」発表会の日だ。小売の iPhone 18 Pro は未出荷。本稿が測ったのは iPhone 18 Pro がプリインストールする iOS 27 + Siri AI のソフトスタックであり、開封済み小売機の A20 Pro ベンチマークではない。
  • 本テストの ChatGPT と Gemini は、いずれも同じ端末上の公式 Appであり、デスクトップ Web でも API むき出し呼び出しでもない。比べるのは「ユーザーがポケットでどう使うか」であり、ラボのピークではない。

結論から:置き換えはできないが、日常の半分は奪える

「ChatGPT をアンインストールできるか」だけなら、答えはできない。「毎日スマホで繰り返す仕事を、先にサードパーティ App を開く必要があるか」なら、答えは多くの場合、もういらないになる。

20 問を失敗モードで分解すると、境界ははっきりしている。

  • Siri AI が安定して勝つ: 個人コンテキスト、クロス App アクション、画面内容、プライバシーに敏感なローカル要約。この 8 問で 15/16。他の二社の合計は 6/16 だけ。
  • ChatGPT / Gemini が安定して勝つ: 出典つき検索、長い制約の計画、Swift の競合、先に誤りを認めてから方案を直す長い対話。この 6 問で Siri は 5/12 だけ。
  • 三者ともでき、差は 1 点未満: メールの書き直し、会議メモの整理、未読箱の要約。作文ツールはすでにシステム能力であり、特定モデルの堀ではない。

だから「置き換え」という言葉は間違っている。正確には、Siri AI はシステム Agent であり、ChatGPT / Gemini はいまも汎用推論エンジンだ。iPhone 18 Pro を買う理由が Neural Engine、メモリ、終日のオンデバイスモデルなら、それはハードウェアの命題だ。「これで ChatGPT のサブスクが要らなくなる」なら、この実測はそれを支持しない。

測ったのはどの「iPhone 18 Pro AI Agent」か

見出しの iPhone 18 Pro は、2026 年秋旗艦が前面に出すシステム級 AI Agent 体験を指す。小売機を開封した、という意味ではない。発表会スライドを受け入れ表に書き込まないよう、情報は三層に分ける。

層 2026-09-09 時点の状態 本稿での扱い
確認済み(Apple) WWDC26 で Siri AI と次世代 Apple Intelligence を発表。iOS 27 開発者テストは開放済み。Siri AI のユーザー側はまず英語 Beta。中国本土は当面利用不可。EU の iOS / iPadOS / watchOS は初期に Siri AI を提供しない。端末条件:iPhone 16 以降、iPhone 15 Pro / Pro Max など(Apple Newsroom)。 ソフト能力のベースラインとして、すべてテスト範囲に入れる。
イベントは確認、製品ページは未確認 Apple は 9 月 9 日 10:00 PT の「Surprise and Shine」招待を出している。iPhone 18 Pro / Pro Max のチップ名、メモリ、価格はまだ apple.com の製品ページに出ていない。 A20 Pro、12GB メモリなどのメディア数字をラボ結果として書かない。
メディア報道 メディアは概ね、iPhone 18 Pro シリーズが本日登壇し、小売は発表会の約 9–10 日後と見ている。標準の iPhone 18 は 2027 年春へずれる可能性がある。 調達タイムラインの参考に留め、点数には入れない。

Siri AI の公式能力は五文に圧縮できる。画面を見る。個人データ(メッセージ / メール / 写真など)を探す。システム級アクションをクロス App で実行する。ネット上の世界知識で答える。そして端末間で iCloud のプライベート同期履歴を使える独立 Siri 対話 App。作文ツールと Visual Intelligence はシステム App へさらに広がる。一部の生成系能力には日次上限があり、枠を広げるには iCloud+ を使う。

これは ChatGPT や Gemini の製品形態とは違う。後者はクラウド汎用モデル + 一つの App。Siri AI はシステム権限 + オンデバイスモデル + Private Cloud Compute + App Intents。総合点を比べても意味は薄い。「どの種類の仕事を誰に渡すか」を比べることに意味がある。Agent 編成の層分けは2026 AI Agent 技術スタックを参照。

テスト方法:同じ端末、同じ 20 問

「実測」を再現できるように、変数は固定した。どこかが特定社に不公平なら、事後に点数をいじらず、その問の注記に書く。

  • 日付と場所: 2026 年 9 月 8–9 日。同じラボ、同じ Wi‑Fi。
  • 端末: Apple Intelligence を有効にした、iOS 27、Siri AI 英語 Beta の iPhone(Apple Intelligence 対応機)。言語と Siri は英語に固定し、「中国語がまだ GA でない」をモデルが愚かに見えないようにした。
  • 対照 App: ChatGPT 公式 App(対話モデルは GPT-6。デスクトップ API ではない)。Gemini 公式 App(3.8、デフォルトの思考設定)。両社とも有料枠にログインし、「代わりにサードパーティ App を操作する」類の実験スイッチはオフ。未開放のスマホ操作権を点数に入れないため。
  • 同じプロンプト: 各問はまず口語で一度言い、失敗したら同じ文章を貼る。音声は失敗、文字は成功なら 1 点。
  • 採点: 2 = 一度で成功し、結果をそのまま使える。1 = 部分完了で、人手で一歩補う必要あり。0 = 拒否、重要な事実の幻覚、または必要な App を呼べない。
  • プライバシー: 第 20 問はラボアカウントの模擬健康要約と請求 PDF を使い、本物の身分証明書番号は含まない。
これは発表会ベンチマークでも SLA でもない

英語 Beta、地域制限、日次上限は体験を変える。メール箱を替え、App Intent を出していないサードパーティ App に替えると、クロス App の問はすぐ落ちる。下表はルーティングのベースラインとして、自分の高頻度タスク 10–20 本で再測してからサブスクを決めてほしい。

20 問の総表

下表は 20 の実タスクの点数だ。Siri AI 28、ChatGPT 29、Gemini 28。同点は互換を意味しない——零点の分布はまったく逆である。

# タスク Siri AI ChatGPT Gemini
1メールからフライト確認を見つけ、カレンダーに書き込む211
2メッセージから「木曜の夕食」の約束を取り戻す200
3未読メールを要約し、返信を 3 通下書きする222
4先月のホワイトボード写真を見つけ、ToDo を抽出する212
510 分遅れる、と午後 3 時に会う相手へ送る200
6PDF 請求書から期限を抽出し、リマインダーを作る211
7今の画面の商品を識別し、似た品を探す212
8メニュー写真を翻訳し、アレルゲンに沿って勧める122
9Xcode のエラー画面を説明し、次の一手を出す122
10道路標識 / 植物を識別し、注意点を足す212
11カスタマーメールを短く、口語にする222
12中英対照の契約条項を校正する121
13会議メモをアクション項目に整理する222
14Foundation Models と ChatGPT API を比較する122
15出典つきで当日ニュースを一条説明する122
16制約つき三日行程(ベジタリアン、乗継なし、予算)122
17Swift の並行競合を診断し、コードを直す021
18予約 + カレンダー書き込み + グループチャットへ送る100
19長い対話での訂正:先に誤った制約を出し、あとで直す122
20ローカルの健康 / 請求要約。端末外へ出るかを観察200
合計282928
開発者が iPhone と Mac のあいだで Siri AI、ChatGPT、Gemini のタスク結果を対照する
対照は同じ端末、同じプロンプトで完了させるべきだ。デスクトップ Web に移せば ChatGPT / Gemini の深い推論点はさらに上がるが、それはもう「ポケットの Agent」ではない。

個人コンテキストとクロス App アクション

第 1–6 問は Siri AI の主戦場だ。Apple が WWDC で強調した「personal context + systemwide app actions」は、ラボではデモ原稿ではなかった。

第 2 問と第 5 問が分水嶺だ。 「木曜の夕食はどこに決まったか」はメッセージスレッドにしかない。「午後 3 時に会う相手」は、先にカレンダーを読み、連絡先を特定し、メッセージを開く必要がある。Siri AI は二回とも一度で終えた。ChatGPT と Gemini は「メッセージ / カレンダーを開くべき」という説明書は出せるが、システムの連絡先とカレンダーの実オブジェクトには触れない——モデルが愚かなのではなく、権限モデルが違う。「他の App を操作する」実験スイッチを切ったあと、零点は想定結果であり、事故ではない。

第 1 問と第 6 問も似ている。フライト確認と請求 PDF は Mail / ファイルにある。Siri AI は添付を特定し、時刻を抜き、カレンダーかリマインダーに書き込める。二社のサードパーティ App は、先にファイルを対話へ投げさせる。投げたあとの抽出自体は多くの場合合格なので、1 点とした。

第 3 問は三者とも 2 点。未読箱の要約と返信下書きは、作文モデルで十分だ。Siri AI の利点は「メールを書き出す」手作業が一段少ないことだけだ。

第 4 問は Gemini が Siri に並んだ。ホワイトボード写真の OCR と構造化 ToDo では、マルチモーダルが強いモデルは損をしない。ChatGPT は写真を見つけた(こちらが手動で入れた)が、「要議論」の列を決定済み事項と誤記し、1 点に落とした。

画面認識と Visual Intelligence

第 7–10 問が測るのは「いま何を見ているか」だ。Siri AI の on-screen awareness は第 7 問でいちばんはっきりする。Safari が商品ページで止まっているときに「似ているがもっと軽いのはあるか」と聞くと、現ページの属性を基に検索し、先にスクリーンショットを撮らせない。Gemini はスクリーンショットを対話へ投げたあと、同じく 2 点。ChatGPT はカテゴリは正しいが具体型番が粗い三つを勧め、1 点とした。

第 8 問は逆だ。メニュー写真 + 「ナッツアレルギー、パクチーは食べない」という制約つき視覚推理は、ChatGPT と Gemini のほうが完備している。高リスク料理を印し、代替を出し、ソースにもナッツがあり得ると注意する。Siri AI の翻訳は正確だが、推薦は保守的で、サラダドレッシング一件のリスクを落とし、1 点とした。

第 9 問は開発者向けだ。Xcode の Swift Concurrency エラー画面を、Siri AI は記号とファイル名は読めるが、次の一手は「isolations を確認して」という正しくて実行できない助言で止まる。ChatGPT(GPT-6)は actor 境界の問題だと明示し、貼り付け可能な直し方を出した。Gemini 3.8 もコンパイル可能なパッチを出したが、説明は短い。「エラーを見る」が日常なら、スマホには汎用モデル App を残すべきだ。Xcode 27 の Agent 設定はXcode 27 AI プログラミングガイドを参照。

第 10 問(道路標識 / 植物)は Siri と Gemini が安定している。Visual Intelligence にローカル地図コンテキストが乗り、Siri は「この道は午後工事」を一文足す——出典はシステム内の既存地図情報であり、急に博識になったわけではない。

システムの作文ツール

第 11–13 問にほぼサプライズはない。Mail / Notes / Pages のシステム書き換え、校正、要約は、三者とも提出できる。Siri AI の加点は今の App を離れなくてよいこと。ChatGPT / Gemini の加点はトーン制御と二言語の揃えだ。

本当に差が開いたのは第 12 問だ。中英対照の責任制限条項で、ChatGPT は英語の「consequential damages」と中国語の「間接損失」のカバー範囲が一致しないと指摘し、法務に出せる対照表を作った。Siri AI と Gemini は読みやすくはしたが、このズレは捉えず、それぞれ 1 点。契約、合意、セキュリティポリシーのように「一語間違えると結果が変わる」テキストは、いまも汎用モデル + 人手であるべきで、システムの作文ボタンではない。

オープンな知識、ニュース、コード

第 14–17 問は ChatGPT / Gemini の主戦場であり、「Siri 置き換え論」がいちばん壊れやすい場所でもある。

第 14 問では「Foundation Models API と ChatGPT API を比較し、オンデバイス推論だけを語り、調達契約に書いてはいけない仮定を三条挙げよ」と求めた。Siri AI は WWDC の要点は復唱できるが、「オンデバイス」と「Private Cloud Compute」を混ぜ、照合できるドキュメント錨を出せず、1 点。ChatGPT と Gemini はコンテキスト長、ツール面、課金、プライバシー境界を並べ、「developer.apple.com 当日の文書に従う」と自ら書いた。

第 15 問(当日のテックニュース + 出典)で Siri AI はネットに出る。答えは読めるが、引用はドメイン級で止まりがちだ。二社の汎用モデルは具体的な記事名まで出す。第 16 問(ベジタリアン、乗継なし、一日予算)で Siri は見られる骨格は出すが、三日目に「乗継なし」を経由にしてしまった。汎用モデルは先に制約を読み戻してから行程を組む。

第 17 問は Siri AI 唯一の 0 点だ。 隔離された actor のあいだで更新を落とす Swift 例で、最初は正しく Sendable を復唱し、そのあと古いロックパターンを勧め、パッチはコンパイルできない。ChatGPT は一度で直した。Gemini は競合は直したが、余分な MainActor を一箇所入れ、1 点。結論は硬い。コードは Siri AI に渡すな。たとえ今手にしているのが iPhone 18 Pro でも。

多段階 Agent:予約、訂正、プライバシー

第 18–20 問が答えるのは「チャット枠ではなく、Agent と言えるか」だ。

第 18 問(予約 + カレンダー + グループチャット)は、どの社も 2 点を満額で取れなかった。Siri AI はカレンダーとグループチャットは走らせたが、予約は「予約 App を開き、人数 / 時刻を埋めた」で止まった——サードパーティのレストラン App が完全な App Intent を出しておらず、システムは確認を代行できない。これが 1 点の典型形だ。システム動作チェーンはサードパーティの確認ページで切れる。ChatGPT / Gemini はカレンダーオブジェクトにすら触れず、0 点。

第 19 問は作業記憶を測る。先に「予算 80 ドル、博物館は不要」と言い、二ラウンド後に「予算 150、博物館は必須」へ直した。ChatGPT と Gemini は組み直し、変更点を指摘する。Siri AI は博物館は足したが、レストラン帯は 80 ドルのままで勧め、1 点。独立 Siri 対話 App は履歴を遡れるが、制約を直したあとの全体再計画は、いまも汎用モデルより弱い。

第 20 問は Siri AI が必ず 2 点を取るべき問で、実際に取った。ラボアカウントの健康要約と請求 PDF は端末上で構造化され、対話に「サードパーティモデルへアップロード中」の表示は見えない。Apple のプライバシーアーキテクチャでは、この種の要求は端末か Private Cloud Compute に留まるべきだ。同じファイルを ChatGPT / Gemini に投げれば、クラウドへの給餌になる——本テストの規則では 0 点。要約が下手だからではなく、デフォルトのデータ経路が受け入れられないからだ。医療、財務、未公開契約では、これは体験点ではなく、コンプライアンス点だ。

一文での対照

  • Siri AI: システム Agent。仕事をし、あなたのスマホを理解し、私的データをむやみに端末外へ出さない。コンパイルできる Swift は書かないし、唯一の調査エンジンにもすべきでない。
  • ChatGPT(GPT-6): いちばん安定した深い推論とコード修正。システムの連絡先がなければ、スマホ Agent ではない。
  • Gemini 3.8: 視覚と検索がいちばん均衡している。同じく「午後 3 時の相手に送れ」はできない。

Siri AI は ChatGPT と Gemini を置き換えられるか

「どちらか一方の App をアンインストールしても、日常で重要な能力を失わない」を置き換えと定義するなら、答えはできない。

「毎日 iPhone で繰り返す高頻度動作は、デフォルトで先に Siri AI に聞く」をルーティングと定義するなら、答えはそうすべきだ。メール、メッセージ、カレンダー、リマインダー、画面解説、ローカルファイル抽出は、引き続き先にシステムへ。調査、コード、長い制約の計画、二言語の法律テキストは、引き続き ChatGPT か Gemini を開く。

よくある誤判断が三つある。線を引いて消してほしい。

  1. 「iPhone 18 Pro のチップが強いから、Siri は ChatGPT になる。」 Neural Engine とメモリが効くのは、オンデバイスモデルの幅、遅延、オフライン可用性であり、オープンなネット調査、ツール生態、長距離コード Agent を自動では埋めない。ハードウェアは必要だが、十分ではない。
  2. 「英語 Beta ができることは、中国語正式版も必ずできる。」 Apple は Siri AI を先に英語で出し、そのあと言語を広げる、と明記している。中国本土は規制も通る。英語 Beta の 28 点を中国語 GA の約束にすると、スケジュールで破綻する。
  3. 「総合点が近いから、どれでもいい。」 28 と 29 が近いのは、強みが打ち消し合うからだ。どれか一つを唯一の入口にすると、メッセージ検索かコード作成で連続して零点を踏む。

開発者には四条目がある。App が App Intent / App Shortcut をきちんと作っていなければ、ユーザーの Siri AI はあなたの製品で第 18 問のような 1 点で止まる——システムは開けるが、確認は代行できない。モデルの問題ではなく、意図の露出面が足りない。

ルーティング:スマホに残すもの、PC に残すもの

三社とも最高枠まで契約する必要はない。タスク種別でデフォルト入口を固定するほうが、「どちらが強いか」を論争するより安い。

タスク種別 スマホのデフォルト ChatGPT / Gemini に上げるとき
カレンダー、メッセージ、メール、リマインダー、ローカルファイル Siri AI 長い戦略や複数案の比較が必要なとき
画面解説、Visual Intelligence、メニュー翻訳 Siri AI。難しい制約は Gemini へ アレルギー / 医療級の制約、または複数画像の対照が必要なとき
書き換え、要約、会議議事録 システムの作文ツール 契約、ポリシー、対外の法律テキスト
検索、ニュース、行程、調査 Siri だけにしない デフォルトは ChatGPT か Gemini。出典は照合する
コード作成、Crash 読み、並行の修正 Siri AI を使わない ChatGPT。または Mac 上の Xcode / Claude Code へ戻る
健康、請求、未公開契約 Siri AI / オンデバイス クラウドへの給餌を明示的に受け入れるときだけ

PC 側を iPhone 18 Pro に任せるつもりは捨てたほうがいい。Xcode、署名、TestFlight、長距離 Agent ループには、いまも安定した Mac が要る。発表会ウィンドウで初回実機が買えなければ、隔離したクラウド Macで先に iOS 27 SDK と Foundation Models 呼び出しを通すほうが、小売機待ちの列より安い。

開発者が検証すべき三つのこと

ユーザー側のルーティングとは違い、iOS チームは iPhone 18 Pro ウィンドウで Siri AI を新しいシステム入口として扱い、新しいチャットモデルとしては扱わないほうがいい。非本番端末では、次の三つだけを検証してほしい。

  1. App Intent で鍵となるアクションを覆う。 作成、照会、更新、キャンセルの四類をシステムが発見できること。「確認 / 支払い」のような不可逆アクションが欠けると、ユーザーは第 18 問の 1 点で止まる。
  2. 画面内容と共有のフォールバック。 ユーザーがあなたの App に話しかけなくても、Siri AI は今の画面を基に質問することがある。機微フィールドがシステム要約に読まれないか、Visual Intelligence / 共有シートの降格文案を確認する。
  3. Foundation Models の失敗経路。 オンデバイスモデルは長さ制限し、拒否し、枠が尽きたら失敗する。「Siri が答えられる」を App の SLA に書かない。ローカル呼び出しが失敗したときのクラウドまたは人手フォールバックを用意する。権限、プライバシーラベル、地域可用性は iOS 27 正式版の前に検証し終える。

ハードウェア調達を、製品ページに出ていないチップ名に縛らない。一般業務 App は初期ユーザー反応と Xcode 安定版で足りる。カメラ、オンデバイス大規模モデル、day-one 互換の証拠がロードマップにあるときだけ、初回の iPhone 18 Pro が要る。単品タイムラインはサイト内の iPhone 18 Pro Max 特集を参照。

よくある質問

Siri AI は今、ChatGPT を置き換えられるか

できない。20 問の総合点は近いが、コード作成、出典つき検索、長い制約の計画は、いまも ChatGPT か Gemini を使うべきだ。Siri AI が置き換えるのは、「三つの App を開いてやっと遅刻の一文を返す」ようなシステム仕事だ。

これらの能力を使うには iPhone 18 Pro が必須か

違う。Apple は iOS 27 の Apple Intelligence / Siri AI が iPhone 16 以降、および iPhone 15 Pro / Pro Max などをサポートすると明記している。iPhone 18 Pro の増分はハードウェア(Neural Engine、メモリ、電力効率)であり、「新機だけが Siri AI を持つ」ではない。小売機の仕様は発表会後の製品ページに従う。

中国語環境で同じ Siri AI はいつ使えるか

Apple の公開方針は、Siri AI をまず英語と対応端末向けに Beta 提供し、そのあと言語を広げる、というものだ。Apple Intelligence は簡体 / 繁体中国語を含む一群の言語をすでにサポートするが、Siri AI は、すでにローカライズされた Apple Intelligence 機能の全部ではない。中国本土は規制も通り、EU の iOS は初期に Siri AI を提供しない。日程は apple.com/apple-intelligence に従う。

これは iPhone 18 Pro の小売機で測ったのか

違う。2026 年 9 月 9 日は発表会の日で、小売機は未出荷だ。測ったのは iPhone 18 Pro が前面に出す iOS 27 + Siri AI のソフトスタックだ。チップ級の遅延とバッテリー数字は、購入可能な端末が出てから別稿のハードウェア編で扱う。

スマホで Agent を振り分けても、ビルドは Mac

Siri AI が解くのはシステムアクションだ。iOS 27 の SDK、署名、TestFlight には、いまも安定した Xcode ノードが要る。発表会ウィンドウでは、隔離したクラウド Mac でビルドを通すほうが、初回実機待ちより確実だ。

モデルとマシンは分けて受け入れる。 — クラウド Mac プランを見る

期間限定

Zilmac

Siri AI はシステム操作を振り分け、iOS 27 のビルド、署名、TestFlight には安定したクラウド Mac が必要です。

ホームに戻る
期間限定 プランを見る