DeltaMed Solutions, Inc. — Empowering Excellence & Enabling Quality
内部培训 · 概念大纲

从 AI 到 Agent 三讲

三次课,一次讲完一个模块:先弄清"模型到底在干什么",再看它靠什么变强,最后判断"该不该做、做了怎么验收"。每讲三个板块,各附可自学的参考资料,末尾附一份 Coding Agent 现状速览。

周期
3 次 · 每次一个模块
单次
约 130 分钟 · 含中场休息
前置要求
无,不限技术背景
第 1 讲它是什么

模型的机制、边界和沟通方式,建立共同语言。

运作机制 · 提示词 · 上下文
第 2 讲它怎么变强

知识、工具、自主循环,三种扩展能力的路径。

RAG · 工具与 MCP · Agent
第 3 讲它能不能用

组装成系统之后,怎么评估、怎么控风险。

系统组装 · Coding Agent · 评估与边界
第一讲

它是什么

3 个板块 · 约 130 分钟
0145 min

大模型的运作机制

拆掉神秘感,也拆掉不切实际的期待

  • 下一个词预测:为什么这个机制能表现得像在思考
  • 预训练、微调、对齐三段式,各自解决什么问题
  • 三个硬约束:token、上下文窗口、知识截止日期
  • 幻觉的来源:自信和正确是两件不相干的事
0245 min

提示词与沟通

投入产出比最高的一块

  • 五要素结构:角色、任务、上下文、输出格式、约束
  • 示例驱动:给两个例子胜过写五段说明
  • 推理模型与普通模型的差别,什么时候值得让它多想
  • 四种常见失效:任务笼统、上下文缺失、一次问太多、隐含前提没说
0340 min

上下文

喂什么,决定它能吐出什么

  • 上下文是产出质量的上限,不是配料
  • 长文档、表格、数据集进入模型的方式与损耗
  • 结构化输出:让它直接给 JSON,而不是给散文
  • 上下文污染:对话越长越笨是怎么回事
第二讲

它怎么变强

3 个板块 · 约 130 分钟
0140 min

知识检索与 RAG

让模型用上它没学过的东西

  • 向量与语义检索的直觉解释,不涉及数学
  • 四个步骤:切块、向量化、检索、生成
  • 三个失效点:切断了语义、该召回的没召回、引用是编的
  • 什么时候不需要 RAG:长上下文直接塞更省事也更准
0245 min

工具调用与 MCP

从"会说"到"会做"的分水岭

  • 模型自己做不好的三件事:算数、查实时数据、执行动作
  • 调用循环:模型发起调用,你的代码执行,结果回灌
  • 工具的描述比实现更决定成败
  • MCP:把接系统这件事从一次性胶水变成通用接口
0345 min

Agent 是什么

全课程最关键的一块,第二讲的收束

  • 三档区分:单次调用、工作流、Agent。大部分需求其实只需要工作流
  • Agent 循环:观察、决策、行动、反馈,以及它为什么会绕圈
  • 记忆:会话内上下文与跨会话长期记忆的区别
  • 该不该上 Agent 的四问:复杂度、价值、可行性、出错代价
第三讲

它能不能用

3 个板块 · 约 130 分钟
0145 min

从组件到系统

把前两讲的零件装起来

  • 任务分解与子代理:什么时候拆才划算
  • Coding Agent:把整个项目目录交给它意味着什么
  • 工作流自动化与 Agent 的边界在哪
  • 人在环:哪一步必须有人确认,哪一步可以放手
0240 min

Coding Agent 现状

离我们最近的一类 Agent,末尾附录是这一块的主要材料

  • 补全式助手与 Coding Agent 的分界:有没有执行权
  • 四种形态:终端型、编辑器型、平台型、自托管型
  • 主流工具的取舍,以及为什么这张表只能当快照
  • 对我们的判断:哪些活收益最大、哪些必须设卡、哪些暂不适用
0345 min

评估、成本与边界

在受监管环境里,这一块决定能不能真的用

  • 怎么证明它做对了:评测集与金标准
  • 成本与延迟:token 计费、缓存、模型选型
  • 安全:提示注入、数据泄露、越权调用
  • 受监管场景:数据边界、审计留痕、监管方对 AI 的要求
附录 · 配合第三讲

Coding Agent 现状

补全式助手是你写一半、它接下去;Coding Agent 是你交代一个任务,它自己读代码、改文件、跑测试、看报错再改。差别不在模型强弱,在于它有没有执行权。下面是 2026 年 9 月的格局,这个领域三个月就换一轮,当快照看,别当结论。

四种形态

形态 A终端型

跑在命令行里,直接读仓库、执行命令。自主度最高。

Claude Code · Codex CLI · Aider
形态 B编辑器型

装在 IDE 里,补全、对话、改文件一体,改动看得见。

Cursor · Cline · Trae · 通义灵码
形态 C平台型

在代码托管平台里派任务,它自己开 PR、回评审、触发 CI。

GitHub Copilot · Devin
形态 D自托管型

开源,可换模型、可接私有或本地部署,适合数据不出境。

OpenHands · Cline · Aider

主流工具优缺点

工具形态优点缺点
Claude Code 终端 / IDE / 桌面 全仓库上下文,能跑测试并根据报错自己重来;团队规范可写成配置文件固化;可分派子代理 需订阅,服务在境外;终端形态对非程序员门槛偏高
Codex CLI 终端 / 异步 擅长后台跑长任务、批量开 PR,吞吐高;开源客户端 自主度高时过程不易盯住;同样是境外服务
Cursor 编辑器 上手最快,补全与对话一体,单任务成本低,改动可见性好 要换编辑器;大仓库仍需人工管上下文
GitHub Copilot 平台内置 与 GitHub 流程贴合,开 PR、回评审、跑 CI 都在原有流程里 强绑 GitHub,代码不托管在上面时收益骤减
Cline / Aider
OpenHands
开源 / 自托管 可换模型、可接本地或私有部署,数据不出境场景的现实选项;Aider 每次改动都是一个 commit,审阅方便 要自己搭和维护,效果完全取决于所接的模型
通义灵码 / Trae
CodeBuddy / CodeGeeX
国产 IDE 与插件 网络稳定,中文交互熟练,有企业版与私有化部署选项,价格低或免费 复杂自主任务的能力与第一梯队仍有差距

共同的优点与风险

它带来什么

  • 上下文是整个仓库,不是一个代码片段
  • 能执行:跑测试、读报错、自己再改一轮
  • 团队规范可固化成配置,不必每次重讲
  • 重复性改造收益最大:批量重构、补测试、补注释
  • 读懂一份没人熟悉的旧代码,从几天变成几小时

它的代价

  • 流畅但错的代码最难发现,越像对的越危险
  • 一次几百行的改动,人根本审不过来
  • 成本不透明,长任务的消耗事前难估
  • 代码与数据外发,受监管环境要先解决这一层
  • 依赖外部服务,服务不可用时流程会卡住

对我们的适用判断

收益最大

写检查脚本、批量重构、补注释与文档、快速读懂不熟悉的旧程序

需要设卡

直接进入交付物的程序,产出必须走原有的复核与双人核对流程

暂不适用

任何会接触到受试者可识别信息或未盲态数据的环境

通用参考

下面六个是可以从头读到尾的完整资料。三次课的间隔里,这些是主要的自学材料,前两个是中文入门首选。