首页 / 课程模块 / 模块 07
核心增量 进阶

Agent 测试与评测 亮点

学会科学、系统地评测智能体和大模型,建立质量门禁——用 Agent 测试 Agent。

为什么学这一模块

“怎么评测我们开发出来的 Agent 效果?”——这是上期学员最高频的追问,也是当前人才市场最稀缺的能力。学会了,你就是能给 AI 把质量关的人。本模块聚焦评测方法论与质量门禁体系;AI 产品业务侧的功能、安全与幻觉测试在模块 09 深入。

核心技术栈

RAGAS DeepEval lm-eval-harness LLM-as-Judge 轨迹评测 Golden Trajectory dsh 轨迹回放 Replay AgentBench / Terminal-Bench Langfuse 追踪 质量门禁

技术亮点

Agent 轨迹级评测
2026 主流范式:用 Golden Trajectory 比对 Agent 的每一步决策与工具调用,发现“答案对但过程错”的隐性缺陷
RAGAS + 真实环境基准
RAGAS 四大指标 + AgentBench / Terminal-Bench 真实环境基准,告别“玩具评测”,直击生产可用性
质量门禁 + 链路追踪
新模型 / Prompt / Skill 上线前自动评测;Langfuse 全链路追踪让每次调用可回溯、可问责

核心内容

Agent 评测方法论:非确定性系统评测思维、定性 vs 定量、指标体系设计
文本评测实战:BLEU/ROUGE/BERTScore、lm-eval-harness、LLM-as-Judge 陷阱
多模态评测:文生图评测(CLIP/FID/IS)、主流多模态基准实践
RAG 评测:RAGAS 四大指标、分块策略评测、噪声鲁棒性
模型评测:微调/预训练/后训练质量守门、评测五件套
Agent 效果评测实战:给全部测试智能体建立评测基线、质量门禁
轨迹回放评测:基于 DeepSeek Harness 会话日志的 replay / fork / 比对,发现“答案对但过程错”

实战产出

  • 评测方案设计文档
  • 跑通文本评测 Pipeline
  • 建立 RAG 评测基线
  • 完整评测系统