この記事には楽天アフィリエイトの広告を含みます。 Amazonのアソシエイトとして、PROBEFOLIOは適格販売により収入を得ています。

問い合わせを読み、台帳を調べ、返事の下書きを作るには、複数の作業を順番に実行する仕組みが必要です。Agents APIが受け持つ処理と、アプリ側が決める権限・確認・保存の処理を分けて説明します。

この記事の目次
01

ツールと実行環境で作業を進める

長い時間動くエージェントを作るには、コンテキスト(会話や作業の記憶)の管理、ツールの効率的な使い方、サブエージェントの連携が必要です。さらに、ファイルを扱い、コードを実行し、途中の結果を保存できる環境と、数日間動かせる基盤も欠かせません。

Agents APIは、この土台を丸ごと引き受けます。セッションの管理、オーケストレーション(全体の指揮)、コンテキストの圧縮(コンパクション)、失敗からの復旧はOpenAIが行い、アプリ側はツールと、実行する環境の選択を担当します。

流れは、4ステップです。セッションを作り、タスクを渡し、進み具合を追い(ストリームか、完了を知らせるwebhook)、続きの指示を送る。セッションは長持ちするので、同じセッションに次のタスクを送ったり、作業中に方向を修正したりできます。

Agents APIの構成図(アプリ、Agents API、サンドボックス)の公式ビジュアル(出典:OpenAI)
Agents APIの構成図(アプリ、Agents API、サンドボックス)の公式ビジュアル。公式資料で紹介された画面や外観を確認するための画像です。 出典:OpenAI。
02

ハーネスが肩代わりしてくれること

紹介記事では、次の機能が挙げられています。

自動のコンパクション:会話が長くなり、上限に近づくと、以前の内容を自動で要約して、必要な情報を残す

ツール検索:必要なときに、関連するツールの定義だけを読み込み、トークンとコストを節約する

プログラムによるツール呼び出し:呼び出しの並列実行や、コードの中での結果の絞り込みができる

サブエージェントによる並列化:複雑なタスクを分けて、並行して進める

MCP、独自の関数、Web検索などのツールに対応

環境の選択:OpenAIのサンドボックス、自前のインフラ、Cloudflare・Modal・Vercelなどの提携事業者から選べる

Codexのハーネスは、オープンソースです。中身を読んで、学ぶこともできます。

導入した会社の声も紹介されています。CiridaeのCTOは、導入で評価スコアが0.71から0.85に上がり、サブエージェントの活用で待ち時間が4分の1になったと述べています(OpenAIの紹介記事より)。

03

新しい機能:コンピューター操作

ここからが、DevDayの新しい部分です。コンピューター操作は、エージェントがWebサイトを開いて、ブラウザの画面を操作する機能です。Webサイトのテスト、情報集め、画面(UI)しかないアプリの操作などに使えます。

Agents APIは、OpenAIが用意する環境でブラウザを動かします。アプリ側は、セッションを始めて、イベントを追います。エージェントは、ブラウザで見たことをもとに、次の行動を決めます。

設定は、次のとおりです。

ブラウザ操作の流れ(Duke作成)
ブラウザ操作の流れ。工程のつながりを読み、どこで結果を確認するかを押さえます。 図:Duke note。
04

料金と提供状況

パブリックベータとして、すべての開発者に提供されています。追加料金はなく、モデルのトークン、ツール、OpenAIのサンドボックス(標準のコンテナ料金)の分だけを払います

Agents APIは、いまのところデータの所在地は米国のみで、ゼロデータ保持(ZDR)には非対応です(自前のサンドボックスを選んでも、ZDRの対象にはなりません)

公式の振り返りでは、Pro 500の契約者と、対象のEnterpriseは、CodexとChatGPT Workでも利用できると説明されています

05

試すときの進め方

最初のタスクは、「公開されているドキュメントを読んで、ページのタイトルとURLを報告する」くらいの、小さなものがよいと思います。公式のドキュメントの例も、指示に「サインインせず、サイトのデータを変えないこと」と書いていて、最初は読むだけにとどめる進め方です。

コンピューター操作は、便利な分、できることが広がります。ログインが必要な作業や、お金・削除に関わる作業は、承認の仕組みだけに頼らず、実行の環境そのものを制限するのが安全です。

なお、AWSで開発しているチームには、別の形のAgents APIも登場しました。Amazon Bedrock Managed Agentsの記事もどうぞ。

06

画面操作を含む作業を分けて考える

エージェントは、依頼を受けて必要なツールを順番に使うAIです。たとえば、公開資料を探し、表の項目を読み、台帳の下書きを作るといった複数段階の作業があります。Agents APIは、この実行を続けるための基盤を提供します。

コンピューター操作では、対象の画面を操作できる環境へ接続することが必要です。モデルを指定しただけで手元のChromeが操作できる状態にはなりません。利用する環境、画面、アクセスできるアカウントを設定し、保存や送信をする前に確認する条件を設けます。

最初の検証は、公開情報を読んで結果を会話へ出す作業から始めると、画面の認識と操作結果を確かめやすくなります。ログインや有料購入、送信を含む作業は、別途その操作に必要な認証・確認を扱います。

実行に必要な役割
部分担当する内容
モデル依頼を解釈し、次の操作を選ぶ
実行環境ツールや画面を実際に操作する
アプリの設計対象、権限、保存、確認条件を決める
人の確認成果物と外部への変更を確かめる
QUICK ANSWERS

よくある疑問を、ここで。

使い始める前に、気になるところから。

Agents APIは、文章を1回返すAPIですか?

ツールや実行環境を使って複数の手順を進めるエージェント向けの仕組みです。読めるデータ、操作の権限、結果の保存先を設定して使います。

この記事の内容をもとにした、編集部からの提案です。
画面操作を含む依頼で、先に何を決めますか?

操作する対象、読んでよい情報、変更してよい範囲、外部へ送信する前の確認を決めます。実行結果と失敗した処理を記録し、人が読み戻せるようにします。

この記事の内容をもとにした、編集部からの提案です。

この記事を共有する

X(旧Twitter)(新しいタブで開きます)LINE(新しいタブで開きます)はてなブックマーク(新しいタブで開きます)

商品情報の提供:Supported by Rakuten Developers

SOURCES & EDITORIAL NOTE

出典と、この記事について

公式資料や、記事で参照した発表・報道をまとめています。仕様や料金は、利用する前に最新の案内をご確認ください。

確認した内容と条件は本文に記載しています。結果や使い勝手は、資料や環境によって異なります。編集方針を読む