0%

AI 概念指南

2024 到 2025 年间,AI 领域的新概念密集涌现。ChatGPT、Claude、DeepSeek、Agent、MCP、Vibe Coding 这些名词频繁出现在各种技术讨论中,身边不少朋友想弄清楚它们分别是什么、彼此之间什么关系,却被信息洪流搞得一头雾水。这篇文章的目标是建立一套清晰的认知坐标系,帮你理解 LLM、Agent、Skills、MCP 这些核心概念及其相互关系。掌握这个框架后,面对任何新概念都能快速判断它在整个版图中的位置,也能更准确地选择工具来解决自己的问题。

LLM 的本质

LLM(大语言模型)是 AI 系统的基础。它在海量文本上完成训练,习得了人类的语言模式和知识体系,能够接收自然语言输入并生成文本输出。理解 LLM 需要避开三个常见误区。LLM 不是搜索引擎,搜索引擎从索引库里检索现成答案,LLM 则根据训练数据生成概率最高的回答,这个机制决定了它可能输出看似合理但实际错误的内容,也就是所谓的幻觉。LLM 默认不联网,它的知识存在明确的截止日期(比如 GPT-4 的知识截止于 2024 年初),未经额外配置就无法获取训练之后的信息。LLM 并不具备真正的理解能力,它的运行机制是概率预测,根据前文推断下一个最可能出现的 token,这是大规模模式匹配的结果,不是人类意义上的理解和认知。

模型和产品的区别

模型和产品是两个经常被混淆的概念。模型(如 GPT-4、Claude 3.5)是底层的语言处理能力提供者,产品(如 ChatGPT、Claude 网页版)是包装好的、面向用户的应用程序,包含交互界面、功能逻辑和安全策略。同一个模型可以驱动多个产品,GPT-4 同时支撑着 ChatGPT 和 Microsoft Copilot。拿 GPT-4 和 ChatGPT 做比较就像拿发动机和小轿车做比较,两者根本不在同一个层面上。

主流 LLM 选型

模型 出品方 特点 适合场景
GPT-4/GPT-4o OpenAI 通用能力强,生态完善 创意写作、通用问答
Claude 3.5/4 Anthropic 上下文长(20万token),推理严谨 长文档分析、代码审查
DeepSeek-V3/R1 深度求索 开源、性价比高、数学强 技术研究、预算敏感场景
Gemini 1.5/2.0 Google 多模态原生,谷歌生态 多媒体处理
Qwen2.5 阿里巴巴 中文优化,开源友好 中文场景

普通用户从 ChatGPT 或 Claude 入手即可,预算有限或偏好开源方案的可以试 DeepSeek,中文场景为主的可以考虑 Kimi 或 Qwen。上下文长度是一个容易被忽略但极其关键的参数,它直接决定了模型能处理多少信息。Kimi 的 200 万字上下文约等于几十本书的体量,Claude 的 20 万 token 约等于 30 万汉字,需要处理长篇论文或法律合同的场景必须选择支持大上下文的模型,否则模型在处理后续内容时会丢失前面的信息。

Agent:能自主执行任务的 AI

如果只使用过 ChatGPT 网页版,接触的只是纯对话模式的 LLM。Agent 是一类能自主规划、调用工具、完成完整任务的 AI 系统。LLM 像一本会聊天的百科全书,你问它答,但它不会主动采取行动。Agent 则是一个能独立解决问题的执行者,你告诉它帮我订一张明天去上海的机票,它会自己去查航班、比价、填写信息、完成整个预订流程。

两者的核心差异体现在四个维度。交互方式上,纯对话 LLM 是一问一答,Agent 能多轮自主执行。工具使用上,纯对话 LLM 依赖产品层是否开放工具接口,Agent 的架构本身就是为了调用外部工具而设计的。任务完成上,纯对话 LLM 给建议、生成内容,Agent 实际执行操作并交付结果。记忆能力上,纯对话 LLM 限于单轮或有限轮对话,Agent 能跨会话保持状态和记忆。

ReAct 工作范式

Agent 的工作流程遵循 ReAct 范式(Reasoning + Acting),核心是一个循环:观察环境、理解目标、推理思考、选择工具、执行操作、观察结果,然后进入下一轮迭代,直到任务完成或触发终止条件。以一个具体任务为例,让 Agent 分析一份财报并生成图表,它会先调用文件操作能力读取文件,再调用代码执行能力运行 Python 分析数据,接着调用可视化工具生成图表,最后检查输出是否符合预期,不符合则调整参数重新执行。

主流 Agent 产品

产品 类型 核心能力
Claude Code 编程 Agent 直接操作代码库,批量重构、调试
Manus 通用 Agent 端到端任务自动化,可操作用户界面
AutoGPT 实验性 Agent 自主分解任务、循环执行

Cursor 和 GitHub Copilot 严格来说不是 Agent,它们的定位更接近增强型编辑器,核心价值在于辅助编码,而非自主规划和执行多步骤任务。真正的 Agent 能独立拆解目标、选择路径、调度工具并交付结果。

Skills:Agent 的能力扩展

Skills 是 Agent 能调用的具体能力模块。没有 Skills,Agent 只能停留在推理层面,无法与真实世界产生交互。常见的 Skills 覆盖以下领域:文件操作(读/写/搜索本地文件)、网络搜索(获取实时信息)、代码执行(运行 Python、Bash 等)、数据库查询(SQL 操作)、消息发送(邮件、IM 通知)。Skills 的丰富程度直接决定了 Agent 的能力边界,模型决定了 AI 的能力上限,Agent 决定了 AI 的行动下限,而 Skills 就是这个行动能力的具体载体。

MCP:AI 的标准化接口

MCP(Model Context Protocol)是 Anthropic 在 2024 年 11 月推出的开放协议,目标是标准化 AI 与外部数据源的连接方式。MCP 可以类比为 AI 世界的 USB-C 标准,过去每个 AI 应用要连接一个新的数据库或工具,都需要单独开发适配器,MCP 让开发者只需实现一次接口,就能被所有支持该协议的 AI 应用调用。

MCP 的架构包含三个组件:Host 是运行 AI 的应用程序(如 Claude Code),Client 负责维持 Host 与 Server 之间的连接,Server 提供具体的工具能力(如文件系统访问、GitHub 集成、数据库查询)。目前已有文件系统、GitHub、PostgreSQL 等多种官方 Server 实现,AI 通过 MCP 可以直接访问用户的文件、代码仓库、数据库和协作工具。MCP 是 Agent 能力的核心基础设施,正在成为 AI 连接外部世界的事实标准。

Vibe Coding:用自然语言写代码

Vibe Coding 是前特斯拉 AI 总监 Andrej Karpathy 在 2025 年初提出的概念,指用自然语言描述需求、由 AI 自动生成代码的开发方式。它代表了一种转变:开发者的工作重心从编写代码转向描述需求,从关注语法细节转向表达意图,从手工实现转向审查和迭代。一个典型场景:你描述想做一个待办事项网页,需要支持添加任务、标记完成、删除,界面要简洁美观,AI 就能直接生成完整的 HTML/CSS/JavaScript 代码,开发者只需要审查结果并做微调。

Vibe Coding 的适用边界同样清晰。它适合原型开发、简单应用和脚本任务,复杂系统架构仍然需要专业开发者来做设计决策和性能把控。这种方式对需求描述能力的要求反而更高,需求表达得模糊或不完整,AI 生成的代码也会偏离预期。

产品全景

AI 产品生态可以按用途分为三个大类。

对话产品以 LLM 为核心,主要提供对话交互界面。ChatGPT 底层是 GPT-4o/o3,生态丰富、插件多。Claude 底层是 Claude 3.5/4,上下文长度 20 万 token,推理严谨。Kimi 底层是 Moonshot 自研模型,支持 200 万字超长上下文,处理长文档有优势。DeepSeek 底层是 DeepSeek-V3/R1,开源透明,数学推理能力突出,价格低。

AI 编程助手面向开发场景。Cursor 定位 AI IDE,覆盖日常开发中的代码生成、解释和重构。GitHub Copilot 专注代码补全,在编码过程中实时提供建议。Claude Code 是编程 Agent,面向复杂任务,支持批量重构和多文件操作。日常编码用 Cursor 或 Copilot 足够,涉及大规模代码重构或需要理解整个项目架构时,Claude Code 的能力更强。

内容生成工具覆盖视觉和多媒体领域。Midjourney 图像生成的艺术风格最强,需要通过 Discord 使用。DALL·E 3 与 ChatGPT 深度集成,使用门槛低。Sora 是 OpenAI 的视频生成工具,目前仅对部分用户开放。Nano Banana 是 Google 的实验性图文处理工具,支持图文混合任务,功能仍在迭代中。

选型指南

根据具体需求选择工具:

需求场景 推荐工具 选择依据
日常问答、灵感收集 ChatGPT / Claude 通用性强,交互体验成熟
读论文/长文档/法律文件 Kimi / Claude 上下文窗口大,能处理长文本
写代码、审查代码 Claude Code / Cursor 代码理解和操作能力强
画插画、设计图 Midjourney / DALL·E 3 Midjourney 艺术风格佳,DALL·E 集成方便
做视频内容 Runway / Pika / Sora Sora 暂未全面开放
处理敏感数据 本地模型 + OpenClaw 数据不出本机,隐私可控
数学/逻辑推理 DeepSeek-R1 / Claude / o3 DeepSeek-R1 开源且推理能力强
自动化办公任务 Manus / AutoGPT 端到端任务自动化

根据技术背景选择入门路径:

用户类型 推荐起点 进阶方向
完全小白 ChatGPT 网页版 Claude、Kimi
办公族 Kimi 读文档 + ChatGPT 写作 学习 Prompt 工程
创作者 Midjourney + Claude 学习 AI 工作流
程序员 Cursor / Claude Code MCP + Agent 开发
极客玩家 本地模型 + OpenClaw 自建 AI 工作流

常见误区与使用建议

使用 AI 时需要避开几个常见误区。AI 并不是什么都知道,LLM 有知识截止日期,不联网时无法获取新信息。AI 会犯错,它会产生幻觉,以非常自信的语气输出错误信息。AI 不具备真正的理解能力,它的输出基于概率模式匹配。贵模型不一定适合所有场景,简单任务用小模型(如 GPT-4o-mini)响应更快、成本更低。当前 AI 处于增强人类的阶段,替代的是重复性工作,不是替代人类的全部判断。提示词的关键在于清晰表达需求,不在于堆砌复杂的措辞。

几条实践建议。重要信息用多个 AI 或搜索引擎交叉验证,不要盲信单一来源。给 AI 足够的背景信息和上下文,输入质量直接决定输出质量。第一次结果不满意时继续追问和细化需求,迭代是获得高质量输出的正常路径。了解 AI 的能力边界,创意生成、信息整理、初稿撰写适合交给 AI,关键决策、医疗和法律建议仍需专业判断。AI 的输出具有不确定性,重要内容要及时保存。


参考资料

扫描二维码分享