第 03 模块 · 1 节

不同模型的适用场景

《Codex 基础入门》03 模型与任务 · 本节时长 26 分钟

没有「最好」的模型,只有「最合适」的

上一节讲了「按任务选模型」的思路。这一节展开讲:不同模型到底擅长什么,怎么选到「合适」而不是「最强」的。

选模型的目标不是「用最贵的」,而是「花最合适的钱,办最合适的事」。

贯穿项目text-tools 写核心的文本处理逻辑(要准)和写中文说明文档(要自然),可能值得用不同的模型。按「这段代码/文档具体要什么」来挑,是让 text-tools 又稳又省的关键。

从几个维度看模型的差异

选模型,主要看这几个维度:

维度 说明 影响
能力 聪明程度、复杂任务表现 太难的任务得用强的
速度 响应快慢 简单任务用快的
成本 单价高低 量大要算账
特长 擅长代码?中文?长上下文? 按场景选

没有模型样样第一。每个模型都是「取舍」的结果,你按需求挑。

一个可复制的对照示例——用「同一个问题」测不同模型的表现:

codex "请用中文写一段 30 字的 text-tools 使用说明"

如果你能切换后端模型,分别跑一遍同样的问题,就能直观感受「中文能力」和「表达能力」的差异。这是「用试的选型」,不是「听说的选型」。


场景化选型:几个例子

写代码 / 改 bug

代码任务是 Codex 的主场。选代码能力强的模型,输出更可靠。

text-tools 实现文本处理核心逻辑,就归这类——代码模型写出的正则、边界处理更稳。

写文档 / 总结

重中文表达。选中文能力好的模型,措辞更自然。

text-tools 写 README、写使用说明,这类任务可以换中文表达强的模型。

长文档 / 大项目理解

需要记很多上下文。选长上下文好的模型,不容易丢信息。

text-tools 文件多起来后,让模型「通读整个工具、梳理结构」就属这类。

大量简单机械任务

量大、重复。选便宜 + 快的模型,压成本。

text-tools 批量生成测试用例、批量改格式,这类活用快省模型。


国内模型的现实情况

本课程的立足点:国内大模型(如 DeepSeek)能力已经很强,足够支撑多数开发任务。

  • 代码、中文、日常业务 → 国内模型完全够用
  • 无需依赖官方海外模型,无需翻墙

所以你不必「非强不用」,多数情况国产模型就是好选择

一个可复制示例——直接用它干活,别先纠结「够不够强」:

codex "在 text-tools 里加一个功能:把输入文本中的换行替换成空格。写进 tool.py 并跑通"

先用够用的国产模型把它做出来,不满足再考虑升模型。


怎么实际选:试出来

选型不要靠猜,靠

  1. 先定任务类型(代码?中文?长文?)
  2. 从「够用」的模型起步
  3. 效果不满意,升一级
  4. 效果好,就固定用这个

从够用起步,按效果微调,比一上来纠结「哪个最强」实用得多。


落地练习:给 text-tools 挑「合适」的模型

不用真的拥有多个模型,先在逻辑上走一遍「按场景选型」的完整流程:

  1. 列出 text-tools 里的三类任务:写代码、写中文文档、批量机械活
  2. 分别写下这三类各自「该优先看哪个维度」(代码→能力/代码特长;文档→中文;机械→成本/速度)
  3. 想想哪些任务用同一个「够用」的模型就行,哪些值得为它专门升模型

怎么判断做对了?——你能给 text-tools 的每个任务类配出「优先看的维度」,并且明白「不是所有任务都要最强模型」。能说清「给 text-tools 写核心逻辑值得用好一点的代码模型,但批量跑一遍格式调整用便宜的就够」,就算过关。

卡住了怎么办? 不知道模型能力差异?先别纠结,用你已配置好的那个「够用」的模型把所有任务都做一遍,实践出真知。觉得「挑维度」抽象?就记住一句话:写代码看代码能力,写中文看中文能力,量大看成本


常见坑:为「最强」付费,而不是为「够用」付费

新手容易掉进「越贵越强越安心」的陷阱:所有任务都上最强模型,理由是「反正用得起」。

问题是——很多任务根本用不到那么强的能力,结果是你为用不上的部分白白多花钱、多等时间。正确心态是为「够用」付费:任务需要什么能力,就为那个能力买单。给 text-tools 加个 trim 函数,和一个需要深度推理的重构任务,不该是同一个选择。省下的,是可以投入到更重要任务的预算。


小结

  1. 没有最好,只有最合适——按任务挑
  2. 维度:能力、速度、成本、特长
  3. 国内模型(DeepSeek)能力够用,多数场景是好选择
  4. 靠试:从够用起步,效果不满意再升级
  5. text-tools:写代码看代码能力,写中文看中文能力,量大看成本

下一节,学怎么写清楚任务描述。