01 / DECIDE
架構決策
適合 document intake、visual QA、accessibility assistance,以及文字與有限影像證據的 workflow。
定義 model 可從 image 推論什麼、保存原始 asset reference,並把 observation 與後續 decision 分開。 先把 input、output、state 與 side effect 畫成一條可觀察路徑,再決定 把 image understanding 當成證據抽取 要放在哪一層。
02 / BUILD
三步實作
- 01
框定合約
先寫下 caller、資料分類、成功條件、timeout、取消與 ownership。適合 document intake、visual QA、accessibility assistance,以及文字與有限影像證據的 workflow。
- 02
建立單一路徑
只實作一條 end-to-end path,保留 request correlation、typed state 與可逆 failure handling。定義 model 可從 image 推論什麼、保存原始 asset reference,並把 observation 與後續 decision 分開。
- 03
證明結果
把驗收寫成可重跑的 fixture、contract test 或 browser test。以 labeled image set 衡量 extraction accuracy、abstention、OCR failure,以及 crop/resolution 敏感度。
03 / BOUND
Production 邊界
不可把視覺輸出當成身分驗證、醫療診斷或高影響決策的唯一依據。
04 / PROVE
驗收證據
以 labeled image set 衡量 extraction accuracy、abstention、OCR failure,以及 crop/resolution 敏感度。
SOURCE / HTTP
可重現來源探針
curl -fsSI 'https://developers.openai.com/api/docs/guides/images-vision' | sed -n '1,5p'