探索与比较不同大语言模型:Generative AI for Beginners 课程中的模型选型、评估与部署实践指南

探索与比较不同大语言模型:Generative AI for Beginners 课程中的模型选型、评估与部署实践指南 探索与比较不同大语言模型Generative AI for Beginners 课程中的模型选型、评估与部署实践指南【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners本文基于 generative-ai-for-beginners 课程第 2 课孟加拉语翻译版整理扩写系统讲解当前大语言模型LLM的分类维度、在云平台上测试与迭代模型的方法以及通过上下文提示工程、RAG、微调等手段提升 LLM 输出结果的完整路径。读完后你将能够为自己的业务场景选对模型、制定模型评估与迭代流程并理解企业部署 LLM 的几种典型方式。需要说明的是该文档是课程英文原版的自动翻译版本由 AI 翻译服务 Co-op Translator 完成英文原版为权威来源文中涉及外部平台的具体表述以原版为准。课程定位与学习目标本课承接第 1 课生成式 AI 如何改变技术格局、LLM 的工作原理、企业如何将其应用到业务场景核心任务是带领初创团队探索当前 LLM 生态理解不同模型各自的优缺点从而判断哪些模型适合自身场景。本课覆盖三个主题当前生态中不同种类的 LLM在 Azure 上对你的用例测试、迭代并比较不同模型LLM 的部署方式。完成本课后的学习目标能为自己的用例选择合适的模型理解如何测试、迭代并改进模型性能了解企业如何部署模型。理解 LLM 的主要分类维度LLM 可以按架构、训练数据和用途进行多重分类。理解这些差异能帮助团队为特定场景选对模型并清楚后续如何测试、迭代和提升性能。模型选型取决于你想用它做什么、你有哪些数据、预算如何等等。按用途分类音频、图像、文本与多模态不同用途对应不同类型的模型音频与语音识别。Whisper 类模型依然是很有用的通用语音识别模型但生产环境中的选择也包括更新的语音转文本模型例如gpt-4o-transcribe、gpt-4o-mini-transcribe以及说话人分离diarization变体。选型时应评估语言覆盖、说话人分离、实时支持、延迟与成本。图像生成。DALL-E 与 Midjourney 是广为人知的图像生成选项当前 OpenAI 的图像 API 以 GPT Image 系列模型如gpt-image-2为中心Stable Diffusion、Imagen、Flux 等模型家族也是常见选择。选型时比较提示词遵循度、编辑能力、风格控制、安全要求与许可证。课程 第 9 课 会深入图像生成应用。文本生成。文本模型如今横跨前沿模型、推理模型、低延迟小模型与开放权重模型例如 OpenAI GPT-5.x、Anthropic Claude 4.x、Google Gemini 3.x、Meta Llama 4 与 Mistral 系列。不能只看发布日期或价格而要比较任务质量、延迟、上下文窗口、工具调用能力、安全行为、区域可用性与总成本。多模态。许多当前模型能处理文本以外的输入有的支持图像、音频或视频输入有的能调用工具专用模型还能生成图像、音频或视频。例如当前 OpenAI 模型支持文本与图像输入Gemini 系列视变体不同可支持文本、代码、图像、音频、视频输入Llama 4 Scout 和 Maverick 是原生多模态的开放权重模型。搭建工作流前务必核对每个模型卡片声明的输入/输出模态。基础模型Foundation Model与 LLM 的关系示意对应原文档Foundation Model versus LLM章节配图。基础模型Foundation Model与 LLM基础模型这一术语由斯坦福研究者提出指满足以下若干标准的 AI 模型采用无监督或自监督学习训练在未标记的多模态数据上训练训练过程不需要人工标注或数据打标规模很大基于非常深的神经网络训练了数十亿级参数通常作为其他模型的地基可作为起点被进一步微调fine-tune衍生出面向具体任务的模型。以 ChatGPT 为例其早期版本以 GPT-3.5 作为基础模型OpenAI 随后使用聊天专用数据与对齐技术训练出一个在对话场景如聊天机器人中表现更好的调优版本。现代 AI 服务常常在多个模型变体之间做路由因此服务名与底层模型名并不总是一回事。开放权重/开源与专有模型另一种分类方式是模型的开放程度开放源码与开放权重模型向公众开放模型工件供查看、下载或定制但许可证各不相同——有的是完全开源有的是带使用限制的开放权重模型。当企业需要更多部署控制、数据本地性、成本优化或定制能力时这类模型很有价值但在投产前仍需审查许可证条款、推理成本、维护、安全更新与评估质量。专有模型由厂商拥有并托管通常针对托管生产环境做了优化能提供更好的支持、安全体系、工具集成与规模能力但客户一般无法检查或修改模型权重且必须审阅厂商在隐私、数据保留、合规与可接受使用方面的条款。这里可以结合课程 第 16 课《开放源码模型》 深入理解按照开源倡议OSI的标准一个真正意义上的开源 LLM 应公开训练数据集、完整模型权重、评估代码、微调代码与训练指标——目前只有少数模型如 AllenAI 的 OLMo完全满足这一标准因此课程后续采用开放模型open models这一更宽泛的表述。开放模型的核心优势包括高度可定制、单 token 成本低、以及模型组合的灵活性。按输出分类嵌入、图像生成、文本与代码生成嵌入Embedding模型将文本转换为数值形式即嵌入向量是输入文本的数值化表示。它让机器更容易理解词与句之间的语义关系输出可被分类模型、聚类模型等更擅长处理数值数据的下游模型消费。嵌入模型也常用于迁移学习先在有大量数据的代理任务上构建模型再把其权重嵌入复用到其他下游任务。图像生成模型用于图像编辑、合成与翻译通常在大规模图像数据集如 LAION-5B上训练可生成新图像也可通过修复inpainting、超分辨率、上色等技术编辑现有图像。文本与代码生成模型用于摘要、翻译、问答等任务文本模型常在大规模文本语料上训练代码生成模型则常在 GitHub 等大规模代码数据集上训练用于生成新代码或修复既有代码中的 bug。架构维度编码器-解码器 与 纯解码器原文档用一个出试卷的类比来解释架构差异值得完整保留假设你的经理让你为学生写一份测验quiz你有两位同事——一位负责出题一位负责审核。出题者像纯解码器decoder-only模型看着题目和你已写的内容基于上下文继续生成。它们很擅长写引人入胜、信息丰富的内容但在只做分类、检索、编码这类任务时未必是最佳选择。GPT 与 Llama 系列都是纯解码器模型家族的例子。审核者像纯编码器encoder-only模型审阅写好的课程与答案注意到两者间的关系、理解上下文但不擅长生成内容。BERT 是典型代表。既能出题又能审核的人则是编码器-解码器encoder-decoder模型例如 BART 和 T5。服务 与 模型服务与模型是两个容易混淆的概念服务是云服务商提供的产品通常是模型、数据与其他组件的组合模型是服务的核心组件往往就是一个基础模型如某个 LLM。服务通常面向生产环境优化往往通过图形界面使用比直接用模型更方便代价是通常需要订阅或按量付费pay-as-you-go按使用量计费换取服务商的硬件资源、成本优化与弹性伸缩。Azure OpenAI 服务即为例证提供按量付费计划并在模型能力之上叠加企业级安全与负责任 AI 框架。模型则是纯粹的神经网络工件参数、权重、架构、分词器tokenizer及配套配置。要在本地或私有环境运行模型你需要自备硬件、推理基础设施与监控能力并持有匹配的开放权重许可证或商业许可证。Llama 4、Mistral 等开放权重模型可以自托管但仍然需要算力与运维能力。在云平台上测试与迭代模型以 Microsoft Foundry 为例团队探索 LLM 生态并圈定候选模型后下一步就是在自己的数据和负载上测试。这是一个通过实验与度量完成的迭代过程。前述大部分模型OpenAI 模型、Llama 4 与 Mistral 等开放权重模型、Hugging Face 模型都可以在 Microsoft Foundry前身为 Azure AI Studio / Azure AI Foundry的模型目录Model Catalog中获得。Microsoft Foundry 是 Azure 上构建 AI 应用与智能体的统一平台帮助开发者管理从实验、评估到部署、监控与治理的全生命周期。其模型目录使用户能够检索感兴趣的基础模型——包括 Azure 售卖的模型以及合作伙伴与社区提供方的模型可按任务、提供方、许可证、部署选项或名称过滤审阅模型卡片Model Card——包含预期用途与训练数据的详细描述、代码示例以及内部评估库中的评估结果对比基准Benchmarks——通过 Model Benchmarks 面板比较行业可用的模型与数据集评估哪个最匹配业务场景微调Fine-tune——在自定义训练数据上微调受支持的模型利用平台的实验与跟踪能力提升特定负载下的性能部署Deploy——将原始预训练模型或微调版本部署到远程实时推理端点托管算力或 Serverless 部署供应用消费。Foundry 模型目录界面。注意目录中的模型并非都支持微调或按量付费pay-as-you-go部署具体能力与限制请以模型卡片为准。提升 LLM 结果的方法从上下文工程到微调企业部署 LLM 的方式示意来源标注Fiddler AI Blog见英文原版。团队可以用不同训练程度的模型在 LLM 中获取所需结果复杂度、成本与质量各不相同。原文档给出三条主要路径加一条兜底路径带上下文的提示工程Prompt engineering with context在提示中提供足够上下文确保拿到需要的回答检索增强生成RAG你的数据可能存在于数据库或 Web 端点中提示时抓取相关数据并将其作为用户提示的一部分微调模型Fine-tuned model用自己的数据继续训练模型使其更精确、更贴合需求但成本可能更高从头训练模型Trained model最难、最复杂的路径。带上下文的提示工程预训练 LLM 在通用自然语言任务上表现良好——哪怕只给一个很短的提示如补全句子、提一个问题这就是所谓的零样本zero-shot学习。但用户把问题框定得越清楚——给出详细请求和示例即上下文——回答就越准确、越贴近预期提示中只有一个示例时称为单样本one-shot学习多个示例时称为少样本few-shot学习。带上下文的提示工程是最具成本效益的起步方式。检索增强生成RAGLLM 的局限在于它只能使用训练期间见过的数据来生成答案因此不知道训练过程之后发生的事实也无法访问非公开信息如公司数据。RAG 通过在提示长度限制内以文档块chunks形式为提示注入外部数据来克服这一局限。向量数据库工具如 Azure Vector Search 这类产品负责从预定义的数据源中检索有用片段并加入提示上下文。当企业没有足够数据、时间或资源去微调 LLM但仍希望提升特定负载的性能、降低幻觉/过时/无依据答案的风险时RAG 非常有用。课程 第 15 课《RAG 与向量数据库》 给出了完整机制知识库预分块与嵌入、向量检索、以及 RAG-Sequence 与 RAG-Token 两种实现范式并提供了基于课程自身数据的实操 Notebook。微调模型微调fine-tuning是利用迁移学习让模型适配下游任务或解决特定问题的过程。与少样本学习和 RAG 不同它会产生一个新模型权重与偏置被更新需要一组由单一输入提示 关联输出补全构成的训练样例。以下情况适合优先选择微调使用更小的任务专用模型与其反复提示一个更大的前沿模型不如微调一个较小模型处理窄任务得到成本更低、速度更快的方案延迟敏感某些用例中延迟很关键无法使用超长提示或需要让模型记住的示例数量超出提示长度限制稳定行为企业拥有大量高质量样例希望模型一致地遵循某类任务模式、输出格式、语气或领域风格。注意如果主要问题是经常变化的新鲜事实或私有知识应使用 RAG 而非仅靠微调。课程 第 18 课《微调你的 LLM》 进一步给出了微调前的决策清单——明确用例、先尝试提示工程/RAG 建立基线、评估可调性/数据/算力/人力成本、确认质量与 token 成本收益——并提供了 OpenAI、Azure、Hugging Facetransformers/TRL、AutoTrain、Unsloth 等多条实操教程路径。从头训练模型从头训练 LLM 无疑是最困难、最复杂的路线需要海量数据、专业团队与相应算力。只有当企业拥有领域专用用例与大量领域中心数据时才应考虑这一选项。此外课程 第 19 课 介绍的小语言模型SLM路线——通过压缩/蒸馏大模型得到更紧凑、适合资源受限环境的模型如 Mistral 7B 与 ChatGPT 级参数规模的对比——也是在算力受限前提下落地 LLM 能力的另一种务实选择。知识检验问提升 LLM 补全结果的好方法有哪些带上下文的提示工程RAG微调模型答依据英文原版三者都有帮助。先用带上下文的提示工程快速见效当模型需要最新事实或企业私有数据时引入 RAG当你拥有足够高质量样例、且需要模型稳定遵循特定任务/格式/语气/领域模式时再选择微调。孟加拉语版原文给出的倾向是有时间、资源与高质量数据时选微调时间紧则先考虑 RAG两者并不矛盾微调更偏固化行为RAG 更偏注入知识。延伸任务与后续课程挑战围绕如何用 RAG 服务你的业务做进一步调研可参考第 15 课的实操 Notebook notebook-rag-vector-databases.ipynb想深入开放权重模型Llama 2、Mistral、Falcon 等的选型阅读 第 16 课《开放源码模型》进入 第 3 课《负责任地使用生成式 AI》了解偏见、公平性、安全与合规等负责任 AI 议题——这是模型选型之后必须面对的下一道门槛。【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考