系統功能與工作範圍
- 針對看圖敘述與問答等題型,結合圖片、題目與學生語音評估口說表現。
- 整合 acoustic features、language use、image/question analysis、視覺語言模型與 LLM 的多面向評分。
個人貢獻與成果
- 微調 BLIP-2 並設計 T5 語言模型的提示,改善多模態口說評量;熟悉內容準確率 71%,未見內容 68%。
- 成果發表於 O-COCOSDA 2024,並延伸為 SLaTE 2025 第一作者論文的資料增強方法。
- 與 LTTC、NTNU Speech and Machine Intelligence Laboratory 合作;Advisor: Prof. Berlin Chen。