GPT WORLD / INDEPENDENT CODEX FIELD MANUAL 來源檢視 · 2026-07-31

回顧期號 / VISION

把 image understanding 當成證據抽取

定義 model 可從 image 推論什麼、保存原始 asset reference,並把 observation 與後續 decision 分開。

01 / DECIDE

架構決策

適合 document intake、visual QA、accessibility assistance,以及文字與有限影像證據的 workflow。

定義 model 可從 image 推論什麼、保存原始 asset reference,並把 observation 與後續 decision 分開。 先把 input、output、state 與 side effect 畫成一條可觀察路徑,再決定 把 image understanding 當成證據抽取 要放在哪一層。

02 / BUILD

三步實作

  1. 01

    框定合約

    先寫下 caller、資料分類、成功條件、timeout、取消與 ownership。適合 document intake、visual QA、accessibility assistance,以及文字與有限影像證據的 workflow。

  2. 02

    建立單一路徑

    只實作一條 end-to-end path,保留 request correlation、typed state 與可逆 failure handling。定義 model 可從 image 推論什麼、保存原始 asset reference,並把 observation 與後續 decision 分開。

  3. 03

    證明結果

    把驗收寫成可重跑的 fixture、contract test 或 browser test。以 labeled image set 衡量 extraction accuracy、abstention、OCR failure,以及 crop/resolution 敏感度。

03 / BOUND

Production 邊界

不可把視覺輸出當成身分驗證、醫療診斷或高影響決策的唯一依據。

04 / PROVE

驗收證據

以 labeled image set 衡量 extraction accuracy、abstention、OCR failure,以及 crop/resolution 敏感度。

SOURCE / HTTP

可重現來源探針

curl -fsSI 'https://developers.openai.com/api/docs/guides/images-vision' | sed -n '1,5p'