没有「最好」的模型,只有「最合适」的
上一节讲了「按任务选模型」的思路。这一节展开讲:不同模型到底擅长什么,怎么选到「合适」而不是「最强」的。
选模型的目标不是「用最贵的」,而是「花最合适的钱,办最合适的事」。
text-tools 写核心的文本处理逻辑(要准)和写中文说明文档(要自然),可能值得用不同的模型。按「这段代码/文档具体要什么」来挑,是让 text-tools 又稳又省的关键。从几个维度看模型的差异
选模型,主要看这几个维度:
| 维度 | 说明 | 影响 |
|---|---|---|
| 能力 | 聪明程度、复杂任务表现 | 太难的任务得用强的 |
| 速度 | 响应快慢 | 简单任务用快的 |
| 成本 | 单价高低 | 量大要算账 |
| 特长 | 擅长代码?中文?长上下文? | 按场景选 |
没有模型样样第一。每个模型都是「取舍」的结果,你按需求挑。
一个可复制的对照示例——用「同一个问题」测不同模型的表现:
codex "请用中文写一段 30 字的 text-tools 使用说明"
如果你能切换后端模型,分别跑一遍同样的问题,就能直观感受「中文能力」和「表达能力」的差异。这是「用试的选型」,不是「听说的选型」。
场景化选型:几个例子
写代码 / 改 bug
代码任务是 Codex 的主场。选代码能力强的模型,输出更可靠。
给 text-tools 实现文本处理核心逻辑,就归这类——代码模型写出的正则、边界处理更稳。
写文档 / 总结
重中文表达。选中文能力好的模型,措辞更自然。
给 text-tools 写 README、写使用说明,这类任务可以换中文表达强的模型。
长文档 / 大项目理解
需要记很多上下文。选长上下文好的模型,不容易丢信息。
text-tools 文件多起来后,让模型「通读整个工具、梳理结构」就属这类。
大量简单机械任务
量大、重复。选便宜 + 快的模型,压成本。
给 text-tools 批量生成测试用例、批量改格式,这类活用快省模型。
国内模型的现实情况
本课程的立足点:国内大模型(如 DeepSeek)能力已经很强,足够支撑多数开发任务。
- 代码、中文、日常业务 → 国内模型完全够用
- 无需依赖官方海外模型,无需翻墙
所以你不必「非强不用」,多数情况国产模型就是好选择。
一个可复制示例——直接用它干活,别先纠结「够不够强」:
codex "在 text-tools 里加一个功能:把输入文本中的换行替换成空格。写进 tool.py 并跑通"
先用够用的国产模型把它做出来,不满足再考虑升模型。
怎么实际选:试出来
选型不要靠猜,靠试:
- 先定任务类型(代码?中文?长文?)
- 从「够用」的模型起步
- 效果不满意,升一级
- 效果好,就固定用这个
从够用起步,按效果微调,比一上来纠结「哪个最强」实用得多。
落地练习:给 text-tools 挑「合适」的模型
不用真的拥有多个模型,先在逻辑上走一遍「按场景选型」的完整流程:
- 列出
text-tools里的三类任务:写代码、写中文文档、批量机械活 - 分别写下这三类各自「该优先看哪个维度」(代码→能力/代码特长;文档→中文;机械→成本/速度)
- 想想哪些任务用同一个「够用」的模型就行,哪些值得为它专门升模型
怎么判断做对了?——你能给
text-tools的每个任务类配出「优先看的维度」,并且明白「不是所有任务都要最强模型」。能说清「给 text-tools 写核心逻辑值得用好一点的代码模型,但批量跑一遍格式调整用便宜的就够」,就算过关。
卡住了怎么办? 不知道模型能力差异?先别纠结,用你已配置好的那个「够用」的模型把所有任务都做一遍,实践出真知。觉得「挑维度」抽象?就记住一句话:写代码看代码能力,写中文看中文能力,量大看成本。
常见坑:为「最强」付费,而不是为「够用」付费
新手容易掉进「越贵越强越安心」的陷阱:所有任务都上最强模型,理由是「反正用得起」。
问题是——很多任务根本用不到那么强的能力,结果是你为用不上的部分白白多花钱、多等时间。正确心态是为「够用」付费:任务需要什么能力,就为那个能力买单。给 text-tools 加个 trim 函数,和一个需要深度推理的重构任务,不该是同一个选择。省下的,是可以投入到更重要任务的预算。
小结
- 没有最好,只有最合适——按任务挑
- 维度:能力、速度、成本、特长
- 国内模型(DeepSeek)能力够用,多数场景是好选择
- 靠试:从够用起步,效果不满意再升级
- text-tools:写代码看代码能力,写中文看中文能力,量大看成本
下一节,学怎么写清楚任务描述。