この記事には楽天アフィリエイトの広告を含みます。 Amazonのアソシエイトとして、PROBEFOLIOは適格販売により収入を得ています。
問い合わせを読み、台帳を調べ、返事の下書きを作るには、複数の作業を順番に実行する仕組みが必要です。Agents APIが受け持つ処理と、アプリ側が決める権限・確認・保存の処理を分けて説明します。
この記事の目次
ツールと実行環境で作業を進める
長い時間動くエージェントを作るには、コンテキスト(会話や作業の記憶)の管理、ツールの効率的な使い方、サブエージェントの連携が必要です。さらに、ファイルを扱い、コードを実行し、途中の結果を保存できる環境と、数日間動かせる基盤も欠かせません。
Agents APIは、この土台を丸ごと引き受けます。セッションの管理、オーケストレーション(全体の指揮)、コンテキストの圧縮(コンパクション)、失敗からの復旧はOpenAIが行い、アプリ側はツールと、実行する環境の選択を担当します。
流れは、4ステップです。セッションを作り、タスクを渡し、進み具合を追い(ストリームか、完了を知らせるwebhook)、続きの指示を送る。セッションは長持ちするので、同じセッションに次のタスクを送ったり、作業中に方向を修正したりできます。

ハーネスが肩代わりしてくれること
紹介記事では、次の機能が挙げられています。
自動のコンパクション:会話が長くなり、上限に近づくと、以前の内容を自動で要約して、必要な情報を残す
ツール検索:必要なときに、関連するツールの定義だけを読み込み、トークンとコストを節約する
プログラムによるツール呼び出し:呼び出しの並列実行や、コードの中での結果の絞り込みができる
サブエージェントによる並列化:複雑なタスクを分けて、並行して進める
MCP、独自の関数、Web検索などのツールに対応
環境の選択:OpenAIのサンドボックス、自前のインフラ、Cloudflare・Modal・Vercelなどの提携事業者から選べる
Codexのハーネスは、オープンソースです。中身を読んで、学ぶこともできます。
導入した会社の声も紹介されています。CiridaeのCTOは、導入で評価スコアが0.71から0.85に上がり、サブエージェントの活用で待ち時間が4分の1になったと述べています(OpenAIの紹介記事より)。
新しい機能:コンピューター操作
ここからが、DevDayの新しい部分です。コンピューター操作は、エージェントがWebサイトを開いて、ブラウザの画面を操作する機能です。Webサイトのテスト、情報集め、画面(UI)しかないアプリの操作などに使えます。
Agents APIは、OpenAIが用意する環境でブラウザを動かします。アプリ側は、セッションを始めて、イベントを追います。エージェントは、ブラウザで見たことをもとに、次の行動を決めます。
設定は、次のとおりです。

料金と提供状況
パブリックベータとして、すべての開発者に提供されています。追加料金はなく、モデルのトークン、ツール、OpenAIのサンドボックス(標準のコンテナ料金)の分だけを払います
Agents APIは、いまのところデータの所在地は米国のみで、ゼロデータ保持(ZDR)には非対応です(自前のサンドボックスを選んでも、ZDRの対象にはなりません)
公式の振り返りでは、Pro 500の契約者と、対象のEnterpriseは、CodexとChatGPT Workでも利用できると説明されています
試すときの進め方
最初のタスクは、「公開されているドキュメントを読んで、ページのタイトルとURLを報告する」くらいの、小さなものがよいと思います。公式のドキュメントの例も、指示に「サインインせず、サイトのデータを変えないこと」と書いていて、最初は読むだけにとどめる進め方です。
コンピューター操作は、便利な分、できることが広がります。ログインが必要な作業や、お金・削除に関わる作業は、承認の仕組みだけに頼らず、実行の環境そのものを制限するのが安全です。
なお、AWSで開発しているチームには、別の形のAgents APIも登場しました。Amazon Bedrock Managed Agentsの記事もどうぞ。
画面操作を含む作業を分けて考える
エージェントは、依頼を受けて必要なツールを順番に使うAIです。たとえば、公開資料を探し、表の項目を読み、台帳の下書きを作るといった複数段階の作業があります。Agents APIは、この実行を続けるための基盤を提供します。
コンピューター操作では、対象の画面を操作できる環境へ接続することが必要です。モデルを指定しただけで手元のChromeが操作できる状態にはなりません。利用する環境、画面、アクセスできるアカウントを設定し、保存や送信をする前に確認する条件を設けます。
最初の検証は、公開情報を読んで結果を会話へ出す作業から始めると、画面の認識と操作結果を確かめやすくなります。ログインや有料購入、送信を含む作業は、別途その操作に必要な認証・確認を扱います。
| 部分 | 担当する内容 |
|---|---|
| モデル | 依頼を解釈し、次の操作を選ぶ |
| 実行環境 | ツールや画面を実際に操作する |
| アプリの設計 | 対象、権限、保存、確認条件を決める |
| 人の確認 | 成果物と外部への変更を確かめる |
よくある疑問を、ここで。
使い始める前に、気になるところから。
Agents APIは、文章を1回返すAPIですか?
ツールや実行環境を使って複数の手順を進めるエージェント向けの仕組みです。読めるデータ、操作の権限、結果の保存先を設定して使います。
画面操作を含む依頼で、先に何を決めますか?
操作する対象、読んでよい情報、変更してよい範囲、外部へ送信する前の確認を決めます。実行結果と失敗した処理を記録し、人が読み戻せるようにします。
この記事を共有する
商品情報の提供:Supported by Rakuten Developers
出典と、この記事について
公式資料や、記事で参照した発表・報道をまとめています。仕様や料金は、利用する前に最新の案内をご確認ください。
- OpenAI公式:Agents APIの発表(新しいタブで開きます)
- OpenAI公式:Agents APIの概要(新しいタブで開きます)
- OpenAI「DevDay 2026 の振り返り」(新しいタブで開きます)
- OpenAI公式:Agents APIのコンピューター操作(新しいタブで開きます)
- Dukeの元のニュース解説(新しいタブで開きます)
確認した内容と条件は本文に記載しています。結果や使い勝手は、資料や環境によって異なります。編集方針を読む



ぜひコメントください