JutoNeo 文章

按工作负载选模型,而不是按名气

同时评估质量、延迟、能力与成本的一套简洁方法。

知名度最高的模型不一定适合每一次请求。可靠的选择应从应用必须完成的具体任务开始。

定义验收样本

准备一小组具有代表性的输入、预期特征和失败案例。不要只使用经过打磨的演示数据,还要包含真实业务里的混乱样本。分别评估输出能否完成任务、遵循格式并避免不可接受的错误。

衡量完整请求

把输出质量与首 Token 时间、总延迟、输入 Token、输出 Token 和失败请求一起记录。一个需要重试三次的低价模型,在生产环境中未必更便宜。

保持小规模模型组合

许多应用只需要两到三类模型:快速默认模型、处理困难请求的更强模型,以及可选的编程或视觉专用模型。先从小组合开始,只有真实测量结果证明有必要时再扩展。