首页 / 课程学习 / F2 入门装备
🧰 F2 入门装备

国内外模型选型:特点、成本、适用场景

⏱ 16分钟 📖 第 3/8 节

大模型选型是FDE的基本功。客户问"用什么模型",你不能只说"GPT-4最好",而要根据场景、成本、合规、效果等维度综合判断。

🎯 模型选型不是选"最好的",是选"最合适的"

很多人选模型的逻辑是"哪个好用哪个"——GPT-4o效果最好,那就都用GPT-4o。这个逻辑在个人使用时没问题,但在企业项目里是错的。因为企业项目要考虑的不只是效果,还有成本、合规、延迟、稳定性、可定制性等多个维度。

一个真实的例子:某客户要做客服AI,一开始用GPT-4o,效果很好,但一个月token费用花了8万块。后来FDE帮他们做了模型分层:70%的简单问题(查物流、问营业时间)用国产开源模型(成本降90%),25%的中等复杂问题用Claude 3 Haiku(成本降70%),只有5%的高复杂问题(投诉处理、定制化需求)才用GPT-4o。整体效果几乎没变,但成本从8万降到了8千。

这就是模型选型的价值——不是选最好的,是在效果、成本、合规之间找到最优解。FDE的核心能力之一,就是帮客户做这个最优解的判断。

🌍 国内外主流模型全景

目前主流的大模型可以分为国际模型和国产模型两大类。

  • 国际模型第一梯队:GPT-4o(OpenAI)——综合能力最强,代码、推理、多模态都很强,适合复杂任务;Claude 3.5 Sonnet(Anthropic)——长文本理解最强(200K上下文),写作和分析能力突出,适合文档处理和内容生成;Gemini 1.5 Pro(谷歌)——多模态能力最强(视频理解),超长上下文(1M),适合视频和超长文档处理。
  • 国际模型轻量版:GPT-4o mini——成本低、速度快,适合简单任务;Claude 3 Haiku——速度最快、成本最低,适合高并发简单任务;Gemini Flash——谷歌的轻量模型,性价比高。
  • 国产模型第一梯队:DeepSeek V3——开源模型里综合能力最强,代码和推理突出,可本地部署,成本极低;通义千问Qwen2.5(阿里)——综合能力强,生态完善(通义灵码、通义听悟等),企业服务成熟;文心一言4.0(百度)——中文理解强,搜索增强能力突出,适合中文场景;讯飞星火4.0——语音和多模态强,教育和医疗领域有优势。
  • 国产模型垂直领域:智谱GLM-4——学术和研究领域强,开源生态好;月之暗面Kimi——长文本强(200万字),适合超长文档处理;零一万物Yi——开源模型,可本地部署,适合定制化。

📊 模型选型的六个维度

FDE选模型,看六个维度,按项目优先级排序:

维度一:效果能力。不同模型在不同任务上表现差异很大。代码任务选GPT-4o或DeepSeek Coder;长文本任务选Claude或Kimi;多模态任务选GPT-4o或Gemini;中文任务选国产模型(通义/文心/DeepSeek);推理任务选GPT-4o或Claude 3.5。不要只看综合排名,要看你具体任务上的表现。

维度二:成本。大模型的成本差异巨大,最贵的和最便宜的能差100倍。成本计算要看:输入token价格、输出token价格、缓存价格、并发限制。高并发场景(比如客服AI,每天10万次对话),成本是首要考虑因素;低并发场景(比如内部助手,每天100次对话),成本可以放宽。

维度三:合规与数据安全。这是国内企业项目的硬约束。如果客户是政府、国企、金融、医疗,数据不能出境,那就只能选国产模型,而且最好是可本地部署的(DeepSeek、Qwen、GLM)。如果客户对数据安全要求一般,可以用API调用的方式。记住:合规是红线,不能为了效果突破合规。

维度四:延迟和稳定性。不同场景对延迟要求不同。实时对话场景(客服、语音助手),延迟要在2秒以内,选轻量模型;异步处理场景(文档分析、报告生成),延迟可以放宽到30秒,选能力强的模型。稳定性也要考虑:API的SLA是多少?高峰期会不会限流?有没有备用方案?

维度五:可定制性。有些项目需要微调模型(比如用客户的行业数据微调),这时候要选支持微调的模型(GPT-4o mini支持微调,DeepSeek开源模型可以自己微调,Qwen也支持微调)。有些项目需要用RAG(检索增强生成),所有模型都支持,但效果有差异。

维度六:生态和工具链。模型不是孤立的,要看周边生态。比如用OpenAI的模型,可以用Function Calling、Assistants API、GPTs等工具;用阿里的模型,可以用通义灵码、通义听悟、百炼平台等工具;用DeepSeek,可以用开源生态自己搭。生态完善的模型,开发效率更高。

模型分层策略
最佳实践不是"一个模型用到底",而是"模型分层"——简单任务用便宜的轻量模型,复杂任务用贵的能力强的模型,中间加一个路由层自动判断用哪个模型。这样既能保证效果,又能大幅降低成本。一个好的FDE,交付的不是"用了XX模型",而是"一套模型分层策略"。

📝 模型效果怎么评估

选型不能凭感觉,要靠数据。FDE评估模型效果,用三步法:

第一步:建评估集。从客户的真实场景中抽取100-200条典型样本,标注好"标准答案"。评估集要覆盖:简单题、中等题、难题、边界case、bad case。评估集是模型评估的基础,没有评估集,所有的"效果好"都是主观感受。

第二步:跑对比测试。把评估集分别喂给候选模型,记录每个模型的输出。然后用三个维度评估:准确率(输出和标准答案的匹配度)、完整性(有没有遗漏关键点)、可用性(输出能不能直接用,还是需要大量人工修改)。可以用人工评分(1-5分),也可以用自动评分(用GPT-4当裁判)。

第三步:算综合性价比。效果得分出来后,结合成本、延迟、合规等维度,算综合性价比。比如:模型A效果90分,成本10块/千次;模型B效果85分,成本1块/千次。如果场景对效果要求不是极致,模型B的性价比更高——效果只差5分,但成本差10倍。

记住:模型选型是一个持续的过程,不是一次性的。模型在迭代(每3-6个月就有新模型出来),客户的需求在变化,成本在变化。FDE要定期(每季度)重新评估模型选型,确保用的是当前最优解。

🎯 本节关键要点

  • 1 模型选型不是选最好的,是在效果/成本/合规之间选最合适的
  • 2 国际第一梯队:GPT-4o(综合最强)、Claude 3.5(长文本/写作)、Gemini 1.5(多模态/超长上下文)
  • 3 国产第一梯队:DeepSeek V3(开源最强/成本低)、通义Qwen2.5(生态完善)、文心4.0(中文/搜索)、讯飞星火(语音/多模态)
  • 4 选型六维度:效果能力、成本、合规与数据安全、延迟稳定性、可定制性、生态工具链
  • 5 最佳实践是模型分层:简单任务用便宜模型,复杂任务用强模型,中间加路由层
  • 6 效果评估三步法:建评估集→跑对比测试→算综合性价比
  • 7 模型选型是持续过程,每季度重新评估

你现在能做什么

1

梳理你当前项目的痛点

用本节课学到的方法,列出你当前项目中最痛的3个问题,每个问题量化频次和影响。

2

去案例库看真实案例

进入项目案例库,找到与你行业相关的案例,研究别人是怎么解决类似问题的。

3

用交互工具练习

使用客户对话模拟器(4个真实场景/四维评分/58个学习引导)、MVD画布等交互工具,在模拟场景中练习本节课的方法。

📝 他们会这样考你

Q1

FDE和传统IT交付的本质差异是什么?

Q2

为什么说"需求背后是人"?举一个你工作中的例子。

更多题目:进入在线考试,七套篇章卷350+题等你挑战。