AI Skill Engine:可驗證的 LLM 評分器
- 問題:評估開發者如何與 AI coding agent 協作時,一次讀完整份對話再給分,分數會擠在很窄的區間,分不出熟練者與新手;只調整 prompt 會讓已知樣本變好,保留樣本卻沒有改善。
- 做法:改為逐輪評分,每輪附上前幾輪作為上下文;另建一套獨立的驗證 benchmark,以合成的使用者樣態、可重現的擾動與 A/B 比較檢驗每次修改,讓變差的修改能被發現並撤回。
- 結果:在真實資料上,模型與人工評分的差距落在兩位人工評分者彼此的差距之內;設計取捨與驗證過程都以 ADR 記錄。
Skill Challenge:從出題到報告的端到端流程
- 問題:題目、作答環境與評分標準分開維護時容易彼此不一致,評分結果也難以追溯。
- 做法:設計出題流程,以分階段的人工審查關卡與 AI agent 試作把關;把每題的檢查點拆成最小、可區分的斷言,轉成評分引擎可直接執行的 contract;作答內容以 hash 綁定原始檔案,確保評分證據可追溯。
- 結果:完成出題、作答環境、評分到報告的完整流程,並串接 Google Classroom 自動收件與同步。
- 另建立 AI coding agent 對話紀錄的本機收集工具,匯出前完成去識別化,並在 macOS、Linux 與 Windows 上驗收。