---
title: "OpenAI初の自社チップ「Jalapeño」実測公開 — 電力あたり最大1.9倍、AIがカーネルを書く時代へ【2026年8月最新】"
description: "OpenAIが2026年8月25日、初の自社推論チップJalapeñoの実測結果を公開。NVIDIA GB200比で電力あたり最大1.9倍・応答最大3.6分の1の中身と、AIがチップを設計しプログラムする開発ループ、僕らの仕事への効き方を解説。"
url: "https://shiftb.dev/articles/openai-jalapeno-inference-chip-2026"
publishedAt: "2026-08-26"
updatedAt: "2026-08-26"
author: "立川修平（ぶべ）"
category: "ai-development"
tags: ["OpenAI", "Jalapeño", "AIチップ", "NVIDIA", "AI駆動開発"]
---

# OpenAI初の自社チップ「Jalapeño」実測公開 — 電力あたり最大1.9倍、AIがカーネルを書く時代へ【2026年8月最新】

米国時間2026年8月25日、OpenAIが初の自社推論チップ**「Jalapeño（ハラペーニョ）」の実測結果を初公開**しました。僕がこの発表で最初に目を止めたのは、性能の数字ではなく「AIが書いたカーネルが、人間の専門家の実装より1.5〜1.8倍速く動いた」というくだりです。チップを動かす最下層のプログラムまでAIが書き始めたなら、業務アプリを作る程度のことは、とっくに専門家の独占物ではなくなっています。

僕自身、Vibelyというオンラインスクール向けSaaSを1人で作って運営しており、AIの推論の速さと値段は毎日の作業に直結するテーマです。この記事では、発表された実測値の中身、AIがAIチップを作る開発ループ、そして僕らの仕事への効き方まで書きます。事実関係は2026年8月25日（米国時間）の公式発表に基づきます。

## 8月25日に何が公開されたか — 発表の概要

Jalapeñoは、OpenAIがかねて開発を公表していた初の自社チップで、モデルの学習ではなく**推論（ユーザーの入力に応答を返す処理）専用**に設計されています。今回の[公式発表](https://openai.com/index/jalapeno-first-results/)で初めて、実際に動かした測定値が公開されました。要点は、従来のハードウェアでは二者択一になりがちだった**スループット（時間あたりの処理量）とレイテンシ（応答の速さ）を、1つのアーキテクチャで両取りした**という主張です。

### 公開ベンチマークで、他社モデルまで含めて測定

測定には、調査会社SemiAnalysisが公開しているベンチマーク「InferenceX」が使われました。対象モデルはGPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1Tの3つ。自社モデルだけでなく**他社製のオープンモデル2つを含めて測っている**のは、検証の姿勢として率直だと思います。3モデルを通して、ピーク時の電力あたり処理量は比較システムの**1.5〜1.9倍**、エンドツーエンドのレイテンシは**1.7〜3.6分の1**、対話的なワークロードでは**2.1〜4.1倍**の性能と報告されています。

### 「チップあたり」ではなく「電力あたり」で比較する理由

OpenAIは性能を「チップあたり」ではなく**「消費電力1kWあたり」**で揃えて比較しています。データセンターの制約は設置面積よりも電力供給に移っており、同じ電力でどれだけ仕事をこなせるかが実質的なコストを決めるからです。Jalapeñoの定格電力は700Wで、テストした負荷では実測550W以下に収まったとされています。比較対象のNVIDIA GB200は定格1,200W、GB300は1,400Wです。

## 実測値の中身 — GB200/GB300とどこまで差があるか

付録として公開されたGPT-OSS 120Bでの数値を、比較対象のGB200と並べるとこうなります。

| 指標（GPT-OSS 120B） | Jalapeño | NVIDIA GB200 |
| --- | --- | --- |
| ピーク処理量（トークン/秒/kW） | 85,448 | 44,960 |
| エンドツーエンド応答時間 | 1.03秒 | 1.80秒 |
| 最小トークン間隔（1ユーザーあたり生成速度） | 0.69ms（1,459トークン/秒） | 1.87ms（535トークン/秒） |
| チップ定格電力 | 700W（実測550W以下） | 1,200W |

電力あたりのピーク処理量で約1.9倍、応答時間で約1.7倍。さらに、GB200の最速応答に相当する速度帯で比べると処理量の差は約53.7倍まで開くとされています。最大級のオープンモデルであるKimi K2.5 1Tでも、電力あたり約1.5倍・応答約3.4分の1という結果で、モデルの規模が大きくなるほど優位が広がる傾向も報告されています。

### 数字を読むときの注意点

ただし、これは**OpenAI自身による測定**です。ベンチマーク自体は公開されているものの、第三者による追試はまだありません。また「電力あたり」という土俵設定そのものが、定格700Wという設計を選んだJalapeñoに有利に働く面もあります。速いのは確かでも、倍率の数字はこの前提込みで受け取るのが安全です。発表内でも、フロンティアモデルでの優位は社内測定にとどまることが明記されています。

## AIがチップを設計し、AIがチップをプログラムする

僕がこの発表でいちばん重要だと考えているのはここです。Jalapeñoは、**設計の初期段階からテープアウト（製造用データの完成）までを9ヶ月で終えて**います。設計案の探索、検証ループの短縮、演算回路の最適化にAIが直接使われ、開発期間の圧縮に効いたと説明されています。

### AIが書いたカーネルが、人間の専門家実装を上回った

さらに踏み込んでいるのがプログラミング側です。新しいモデルをチップで高速に動かすには、カーネルと呼ばれる低レイヤーの実装をモデルごとに書き起こす必要があります。OpenAIはこの作業にCodexとGPT-Astraを使い、**当初の製造計画になかったオープンモデル3つを2ヶ月で実用性能に到達**させました。しかもGPT-OSSの一部のアテンション・MoEブロックでは、**AIが生成した実装が人間の専門家が書いた実装より1.5〜1.8倍速く動いた**とされています（モデル全体ではなく選抜したブロックでの数字です）。

カーネル最適化は、ハードウェアの癖を知り尽くした一握りのエンジニアだけが書ける専門領域でした。その領域でAIの実装が人間を上回る事例が出た。この事実は「AIに仕事を奪われるか」という問いよりも、**専門知識の壁で諦めていた仕事に、誰でも手を伸ばせるようになった**という方向で読むべきだ、というのが僕の見立てです。チップの最下層でそれが起きているなら、営業資料の集計を自動化する社内ツールを非エンジニアがAIと作ることは、もう挑戦ですらありません。

![AIがチップを設計し、そのチップがAIを高速化する循環の図解。設計9ヶ月でテープアウト、Codexによるカーネル実装、推論の高速化・低コスト化がループする](https://shiftb.dev/images/articles/openai-jalapeno-inference-chip-2026-loop.png)

## 僕らの仕事への効き方と、いま打てる3ステップ

Jalapeñoは年内にOpenAI自身のインフラへの投入が始まる計画で、第2世代は開発が進行中、第3世代も構想段階に入っています。同日にCFOのサラ・フライヤー氏が公開した[戦略記事](https://openai.com/index/the-full-stack-behind-abundant-intelligence/)では、NVIDIAやAMDなどのチップは引き続き広く使いつつ、自社チップを持つことで**ワークロードごとに最も経済的なシステムを選べる立場を作る**と説明されています。推論が安く速くなるほど、これまで採算が合わなかった用途が実用になり、使用量全体はむしろ増える。発表ではこれをジェヴォンズのパラドックスと呼んでいます。

つまりこの発表が僕らに約束しているのは、新機能ではなく**「AIの応答は今後もっと速く、もっと安くなる」という方向性そのもの**です。とくにエージェント（何十ステップも連続で作業するAI）は、1ステップの遅れが積み重なるので、レイテンシ改善の恩恵を最も大きく受けます。この方向性を前提に、非エンジニアの現職者がいま打てる手を3つにまとめます。

1. **自分が使うAIツールの「裏側の値段」を一度見る（10分）**。使っているツールがどのモデルで動き、APIでいくらかかるのかを料金ページで確認します。この夏は[GPT-5.6 Solの値下げ](https://shiftb.dev/articles/gpt-5-6-sol-price-cut-2026)のように価格改定が続いており、値段の相場観があるだけで社内のツール選定で頼られる側に回れます。
2. **「AIの応答待ち」で止まっている業務を書き出す（15分）**。悪い例は、ベンチマークのスコアだけを見てツールの乗り換えを繰り返すことです。良い例は「この作業はAIの応答が遅いから手作業のままにしている」という業務を洗い出しておくこと。推論が速くなった瞬間に、自動化候補のリストがそのまま武器になります。
3. **小さな業務アプリを1つ作って、推論の消費を体感する（週末1日）**。僕が運営しているJavaScript学習サイトのJSジムは、Boltでトップページを作り、Cursorに引き渡してAIエージェントに実装させるという流れで開発しました。作ってみると、どの操作で推論が走り、どこで待たされるのかが体感でわかります。使用量の感覚は[Codexの使用量リセットの記事](https://shiftb.dev/articles/codex-usage-reset-august-2026)でも書いたとおり、自分で作った人にしか身につきません。

![推論の高速化・低価格化を前提にいま打てる3ステップの図解。ツールの裏側の値段の確認、応答待ちで止まっている業務の書き出し、小さな業務アプリ開発による体感](https://shiftb.dev/images/articles/openai-jalapeno-inference-chip-2026-steps.png)

## まとめ — 速くて安い推論は「使う側の前提」になる

今回の発表を整理します。

- 米国時間8月25日、OpenAIが初の自社推論チップJalapeñoの実測結果を公開した
- 公開ベンチマークInferenceXで、他社モデル2つを含む3モデルを測定。電力あたり処理量1.5〜1.9倍、応答1.7〜3.6分の1、対話的な負荷で2.1〜4.1倍と報告された
- 定格700W（実測550W以下）で、比較対象のGB200（1,200W）・GB300（1,400W）より低電力。ただし自社測定であり、第三者の追試はこれから
- 設計からテープアウトまで9ヶ月。CodexとGPT-Astraによるカーネル実装は、一部ブロックで人間の専門家実装の1.5〜1.8倍の速度に達した
- 年内に自社インフラへ投入開始。第2世代・第3世代の開発も進んでおり、NVIDIA等の外部チップとの併用は継続する

推論の値段と速さは、この2年で一貫して「安く・速く」の方向にしか動いていません。変わったのは、その改善をチップの設計とプログラミングの両面でAI自身が加速し始めたことです。恩恵を受け取る側でいるか、恩恵を使って作る側に回るか。僕はVibelyの機能追加もCS対応の仕組み化も1人とAIでやってきましたが、必要だったのは専門知識より「まず小さく作ってみる」の一歩でした。速くて安い推論が前提になる時代の準備は、その一歩から始まります。

この夏のAIツール・AI業界の動きは、[Anthropic上場の記事](https://shiftb.dev/articles/anthropic-ipo-2026)や[GPT-5.6 Sol値下げの記事](https://shiftb.dev/articles/gpt-5-6-sol-price-cut-2026)でも扱っています。Jalapeñoの性能値は今後の追試や量産で変わる可能性があるため、最新の情報は[OpenAIの公式発表](https://openai.com/index/jalapeno-first-results/)で確認してください。
