01 / DECIDE
架構決策
適合 prompt、model、tool、retrieval 與 orchestration 變更,因為 demo 無法證明穩定。
變更系統前先定義 representative input、human-readable criteria、適當 automated grader 與 baseline。 先把 input、output、state 與 side effect 畫成一條可觀察路徑,再決定 讓 evaluation 成為 release gate 要放在哪一層。
02 / BUILD
三步實作
- 01
框定合約
先寫下 caller、資料分類、成功條件、timeout、取消與 ownership。適合 prompt、model、tool、retrieval 與 orchestration 變更,因為 demo 無法證明穩定。
- 02
建立單一路徑
只實作一條 end-to-end path,保留 request correlation、typed state 與可逆 failure handling。變更系統前先定義 representative input、human-readable criteria、適當 automated grader 與 baseline。
- 03
證明結果
把驗收寫成可重跑的 fixture、contract test 或 browser test。必要 slice 超過約定 regression threshold 時,release automation 會阻擋並保存 comparison artifact。
03 / BOUND
Production 邊界
不可只優化單一分數;納入 safety、refusal、latency、cost 與使用者相關 regression slice。
04 / PROVE
驗收證據
必要 slice 超過約定 regression threshold 時,release automation 會阻擋並保存 comparison artifact。
SOURCE / HTTP
可重現來源探針
curl -fsSI 'https://developers.openai.com/api/docs/guides/evals' | sed -n '1,5p'