台灣的 AI / ML 工程師。碩士畢業,作品集全部公開、全部可重現,每個數字都對得到 commit 裡的檔案。
GitHub kuotunyu 與 Hugging Face steven0226 是同一個人。
Taiwan-based AI/ML engineer. Every repository below is reproducible and evidence-first: locked splits, paired statistics, negative results kept, and README numbers that a script re-derives from committed artifacts.
每個職缺列 3 個主打加 2 個佐證。全部 repo 的定位與證據見各自 README。
| Repo | 做了什麼 | 最硬的數字 |
|---|---|---|
| mvtec-ad2-inspection-platform | MVTec AD 2 異常檢測研究 + 可覆核的地端檢測平台(FastAPI、React、SQLite 租約式 worker、SBOM) | 56 次正式 run 選出 8 類 champion;官方 mixed-lighting 結果如實標為 PRIVATE-NO-GO |
| pcb-defect-detection | YOLO26 PCB 瑕疵偵測,防洩漏配對 A100 協定、L4 部署 benchmark、覆核 UI | 配對實驗與部署證據附 Zenodo DOI |
| aerial-obb-lab | YOLO26 旋轉框偵測(DOTA),ONNX / TensorRT,瀏覽器內 ONNX Runtime Web demo | 456 張驗證圖 28,853 個物件的 HBB / OBB 面積比 1.76×;T4 TensorRT 20.22 ms;微調反而 −0.05 mAP50,照實發佈 |
| SafeSynth · defectforge-visa-synthetic-data | 合成資料能不能救少樣本瑕疵偵測:四臂消融、預註冊 gate、多 seed 複製 | 兩個專案都是誠實的負結果:real-only 0.4511 勝過最佳合成臂 0.3759 |
| steel-defect-segmentation | 鋼材瑕疵實例分割,嚴格 RLE 轉換、YOLO26-seg、ONNX、完整 release 審查包 | — |
| Repo | 做了什麼 | 最硬的數字 |
|---|---|---|
| air-quality | 1982 年起全台逐時空氣品質再分析,DuckDB / Polars 管線、標記不修補的 QC、互動網站與 HF Space | 340,371,384 筆觀測、82 站;PM2.5 原始降幅約 60%,氣象標準化後降幅小 43% |
| CareRisk-48H | ICU 48 小時死亡風險研究:凍結測試集、Platt 校準、預註冊選模、abstention、TRIPOD 稽核 | Set B 只評一次、從未重跑;合成資料 Space 可互動 |
| model-delivery-control-plane | 證據門控的模型交付控制面:內容定址身份、離線驗證器、時序防洩漏、hypothesis 屬性測試 | 45.8k 行、772 個測試、3 個 Dockerfile |
| credit-xai-audit | 台灣信用違約資料的 EBM / LightGBM 校準、bootstrap 不確定性、SHAP 忠實度稽核 | CPU-only 可重現 |
| FormosaNLU-Synth | 本機 27B 老師蒸餾繁中 NLU 合成資料,Gemma-4 與 Phi-4-mini 兩個家族複製 | intent +4.14 pp、joint EM +3.86 pp(配對 seed);兩個 Zenodo DOI;API 花費 $0 |
| Repo | 做了什麼 | 最硬的數字 |
|---|---|---|
| tw-labor-law-rag | 15 部勞動法規 884 條的混合 RAG(BM25 + BGE-M3 + rerank),拒答契約、Docker、離線重算 | Hit@5 0.967、MRR@10 0.906、拒答 10/10 |
| qwen3-vl-chartqa | Qwen3-VL-8B 圖表問答的 QLoRA → AWQ 量化 → vLLM A100 併發部署 | AWQ 只掉 0.72 pp、17.53 → 7.55 GB;vLLM 吞吐 +83.2%;266 項機器驗證重算 README |
| local-inference-bench-gateway | llama.cpp / Ollama / LM Studio 同工作負載 benchmark + OpenAI 相容 gateway(alias、failover、backpressure) | 證據檔案 SHA-256 釘死;gateway 中位數 TTFT 額外開銷 1.66 ms |
| vlm-eval-bench | 配置驅動的 VLM 文件評測(DocVQA / ChartQA / CORD-v2),成本斷路器、離線重算 audit pack | 自己微調的 8B 模型 0.8907 勝過 GPT-5.4-mini 0.6546 |
| llm-inference-engine-benchmark | vLLM vs llama.cpp vs Ollama,3 顆模型 × 併發 1 → 16,同一張 RTX 4090 | 36 個情境全部有效;含 Ollama 對新架構靜默退回單 slot 的偵測 |
| Repo | 做了什麼 | 最硬的數字 |
|---|---|---|
| fhir-care-copilot | FHIR R4 上的 LLM 代理:伺服器注入病人範圍、唯讀工具、可驗證引用、注入攻擊 A/B | 220 案例評測:引用有效率 1.0、未支持宣稱 0.0 |
| doc-inspector | 補助申請文件送件前預檢:VLM 抽取 → 規則引擎 → 紅黃綠,欄位級證據狀態,線上 Space | 24/24 決策回歸;61 個欄位 0% 誤判為已驗證;5 個 release |
| repo-agent | 手寫 agent loop(不靠框架)分析公開 repo:兩階段 Docker sandbox、威脅模型、對抗注入評測 | 36 份報告、31 條可重播 trace,$0 API 成本的 scripted provider 對抗評測 |
| local-llm-mcp | 敏感任務委派給本機 Ollama 的 MCP server,stdio + Streamable HTTP、Bearer auth | 4 個客戶端實測截圖 |
| visual-inspection-reporter | YOLO 偵測 → 商用 VLM 產可追溯的巡檢報告,provider 抽象、快取、退避、成本 | — |
air-quality · tw-labor-law-rag · tw-med-llm-qlora(TAIDE,MedQA 66.17 → 72.05,預註冊非劣性檢定)· ltc-benefit-agent(長照 2.0,金額全由規則引擎算,LLM 只管對話)· tw-longcare-rag · FormosaNLU-Synth · tmmluplus-local-arena(12 種本機模型配置的 33,400 次 TMMLU+ 推論)· taiwan-weather-mcp · zhtw-wiki-semantic-search · tw-filing-intelligence(預註冊可行性研究,保留 NO_GO,Zenodo DOI)· stock-cockpit · twpay-payment-lifecycle
其他:grpo-rlvr-reasoning(GSM8K 70.5 → 79.0,McNemar p=0.0046)· alphazero-connect4(19,200 局自我對弈,Elo 1625.6,線上可對戰)· agentic-rl-wordle · malicious-url-adversarial(對抗訓練把 robust accuracy 從 10.6% 拉到 91.4%)· mysql-ecommerce-analytics · movielens-recsys-mysql-to-gpu · WoundScope · fall-guard-cv · FallSense · vision-xai-reliability-lab · rag-evidence-attribution-bench · coding-agent-eval · receipt-ocr-vlm-benchmark · agent-skills-lab
- 先鎖協定再看結果。 測試集凍結、閾值只在校準資料上選、選模規則事前寫死;CareRisk 的 Set B 只評一次,tw-filing-intelligence 整份研究先預註冊。
- 結果要有統計,不只有一個數字。 配對 McNemar、bootstrap 信賴區間、多 seed 複製;FormosaNLU 跨兩個模型家族重做一次才算數。
- 負結果照樣發佈。 SafeSynth 與 DefectForge 的合成資料沒贏、mvtec 的官方 mixed-lighting 沒過、aerial-obb 的微調反而變差、fall-guard 的跨資料集特異度是 0:都留在 README 裡,附上為什麼。
- README 數字由機器重算。 qwen3-vl-chartqa 的 266 項檢查、mvtec 的 claim 註解、pcb 與 driving-risk 系列的 claims.yaml:改了數字沒改證據就會紅。
- 每個 repo 寫清楚它不宣稱什麼。 研究用途、非臨床、非法律建議、單機快照——claim ceiling 寫在 README,不寫在行銷句裡。
這些專案大量使用 AI 編程工具(Claude Code、Codex)。我的工作是定義問題、設計協定、審查每一個宣稱、決定什麼算證據、什麼該砍掉。SDD ledger、屬性測試、獨立複審記錄與 fail-closed 的 claims 稽核,就是這套分工留下的痕跡;面試時歡迎針對任何一個 repo 的任何一個決策追問。
steven0226:32 個模型、8 個資料集、11 個 Spaces,每個資產都在對應 repo 的 README 裡標明來源與版本。
