應用場景 DeepEval 測試 AI Agent 不該只靠感覺驗收:DeepEval 如何把 LLM 評估帶進 pytest 工作流 DeepEval 是一套開源 LLM 評估框架,將測試案例、品質 metrics 與 threshold 接進熟悉的 pytest/CI 工作流。本文從官方 README 與原始碼脈絡拆解黑箱評估、RAG faithfulness、Agent trajectory、工具正確性與導入治理。 2026年9月2日 閱讀更多
應用場景 Google ADK 多代理系統 不只會呼叫模型:Google ADK 2.0 如何把 Agent 工作流變成可部署的 Python 軟體系統 Google ADK 2.0 將 Agent 應用拆成負責推理與工具使用的 Agent,以及負責執行順序與狀態的 Workflow。本文從原始碼與官方文件拆解工作流執行模型、Task API、多代理、MCP 工具、評估與部署,並整理導入 production 前的實務檢查表。 2026年8月30日 閱讀更多