🤖 Stage 04

Agent 设计与
进阶工程化

Agent 是 AI 能力的集大成者,它能够自主思考、调用工具、完成复杂任务。本阶段深入 ReAct 推理循环、工具调用、MCP 协议和 LLMOps 工程化实践。


Fundamentals
🎯 什么是 AI Agent

AI Agent 是一种能够感知环境、进行推理、做出决策并执行行动的智能系统。它不仅仅是简单的问答,而是能够完成复杂任务的"智能体"。

🔄 Agent 的核心循环
Step 01
思考 (Think)
分析当前任务,决定下一步应该做什么
Step 02
行动 (Act)
执行工具调用或其他操作
Step 03
观察 (Observe)
获取工具执行结果或环境反馈
循环
Repeat
根据观察结果继续思考,直到任务完成
⚡ Agent 的关键能力
计划能力
将复杂任务分解为多个步骤的能力
工具调用
根据任务需求选择并调用合适的工具
记忆能力
记住对话历史和中间结果的能力
反思能力
检查执行结果、发现错误并修正的能力

ReAct Framework
🧠 ReAct 推理框架

ReAct (Reason + Action) 是一种让语言模型通过交替进行推理和行动来解决问题的框架。

📖
ReAct 的核心思想
原理:让模型在思考过程中明确输出"Thought"和"Action",形成可追踪的推理链。

格式示例:
Thought: 用户想了解今天的天气,我需要调用天气查询工具。
Action: {"tool": "weather", "params": {"city": "北京"}}
Observation: 北京今天晴,气温 25-32°C
Thought: 已经获取到天气信息,可以总结回答了。
Action: {"tool": "finish", "params": {"answer": "..."}}
🎯
ReAct 的优势
  • 可解释性:推理过程清晰可见,便于调试和理解
  • 灵活性:支持多种工具和复杂任务流程
  • 自我修正:可以根据观察结果调整策略
  • 任务分解:能够将复杂任务分解为多个简单步骤

MCP Protocol
🔌 MCP 模型上下文协议

MCP (Model Context Protocol) 是 Anthropic 提出的标准化工具调用协议,让 AI 能够标准化调用外部工具与服务。这是我们"调整 MCP"的核心操作对象。

⚙️
核心调整点:MCP 配置
在 Dify 中配置 MCP,让 Agent 具备调用外部工具的能力
模型路由
配置不同模型的调用规则
工具注册
注册自定义工具和插件
权限控制
设置工具调用权限
📊 MCP 协议核心组件
🧩
工具定义 (Tool Definition)
描述工具的名称、功能、参数和返回值格式
JSON Schema
📡
工具调用 (Tool Call)
模型生成的工具调用请求,包含工具名称和参数
结构化输出
📤
工具结果 (Tool Result)
工具执行后返回的结果,传递回模型进行下一步处理
Observation
🌐 MCP 的优势
标准化
统一的工具调用格式,便于跨平台集成
安全性
支持权限控制和调用验证,保障系统安全
扩展性
易于添加新工具,扩展 Agent 能力
跨模型兼容
同一套工具可以被不同模型使用

Practice in Dify
🤖 在 Dify 中创建 Agent

Dify 提供了强大的 Agent 功能,让你可以轻松构建具备工具调用能力的智能助手。

⚙️
工具配置
在 Dify 中配置可用的工具,包括内置工具(搜索、知识库查询、代码执行等)和自定义插件。
内置工具 自定义插件
🧠
思考逻辑
配置 Agent 的思考模式,包括是否启用反思、最大迭代次数、总结策略等。
反思机制 迭代控制
📊
执行日志
查看 Agent 的完整执行过程,包括每一步的思考、工具调用和观察结果,便于调试优化。
调试 追踪

LLMOps
🚀 LLMOps 工程化实践

将 AI 应用从原型推向生产环境需要考虑的工程化问题,包括部署、监控、安全等方面。

📦 部署策略

容器化部署:使用 Docker 容器化 AI 应用,便于在不同环境中部署和扩展。


API 网关:通过 API 网关统一管理多个模型服务,实现负载均衡和限流。


Kubernetes 编排:对于大规模部署,使用 Kubernetes 进行容器编排和自动扩缩容。

📈 监控与日志

性能监控:监控 API 响应时间、吞吐量、错误率等关键指标。


成本监控:跟踪 Token 消耗、API 调用次数,控制成本支出。


日志管理:记录所有请求和响应,便于问题排查和审计。

🔒 安全与合规

数据加密:传输和存储数据时进行加密,保护用户隐私。


访问控制:使用 API Key、OAuth 等方式进行身份验证和授权。


内容安全:对输入输出内容进行审核,防止有害内容生成。

🧪 评估与迭代

A/B 测试:对比不同提示词、模型参数的效果,选择最优方案。


评估指标:使用 BLEU、ROUGE、人工评估等方式衡量输出质量。


持续迭代:根据用户反馈和评估结果持续优化模型和系统。


Resources
📚 推荐学习资源