GPT WORLD / INDEPENDENT CODEX FIELD MANUAL 出典レビュー · 2026-07-31

回顧号 / VISION

image understanding を evidence extraction として扱う

image から推論してよい範囲を定義し、original asset reference を保持し、observation と decision を分ける。

01 / DECIDE

Architecture decision

document intake、visual QA、accessibility assistance、text と bounded image evidence を組み合わせる workflow に使う。

image から推論してよい範囲を定義し、original asset reference を保持し、observation と decision を分ける。 input、output、state、side effect を一つの観測可能な経路にしてから、image understanding を evidence extraction として扱う の所有層を決めます。

02 / BUILD

3段階の実装

  1. 01

    contract を定義

    caller、data classification、success condition、timeout、cancel、ownership を先に記述します。document intake、visual QA、accessibility assistance、text と bounded image evidence を組み合わせる workflow に使う。

  2. 02

    狭い経路を構築

    request correlation、typed state、reversible failure handling を持つ一つの end-to-end path だけを実装します。image から推論してよい範囲を定義し、original asset reference を保持し、observation と decision を分ける。

  3. 03

    outcome を証明

    acceptance を再実行可能な fixture、contract test、browser test にします。labeled image set で extraction accuracy、abstention、OCR failure、crop/resolution 感度を測る。

03 / BOUND

Production boundary

visual output を identity verification、medical diagnosis、重大 decision の唯一根拠にしない。

04 / PROVE

Acceptance evidence

labeled image set で extraction accuracy、abstention、OCR failure、crop/resolution 感度を測る。

SOURCE / HTTP

再現可能な source probe

curl -fsSI 'https://developers.openai.com/api/docs/guides/images-vision' | sed -n '1,5p'