DeepSeek按token计费,额度受模型、缓存、上下文与重试影响。本文面向AI指导老师,拆解规则并给出可落地的省钱策略。
DeepSeek开放平台的额度并非充值后随意消耗的抽象积分,而是与每次API调用的输入输出token、模型选择和缓存状态直接挂钩。AI指导老师如果只关注功能演示,容易在批量批改、社群答疑与课程研发中产生持续累积的token开销。理解计费规则并把省钱动作嵌入工作流,才是长期可用的成本控制。
1. 额度计费的基本盘:Token、模型与缓存命中
DeepSeek的API额度本质上是一套按量计费账户,调用时系统会把请求中的系统提示、历史消息、检索片段和用户问题统一折算为输入token,把模型返回的答案以及推理模型产生的思维链折算为输出token。输入和输出分别计价,输出单价通常更高。以平台公开价目为例,deepseek-chat的输入缓存未命中为2元/百万tokens,缓存命中为0.5元/百万tokens,输出为8元/百万tokens;deepseek-reasoner对应为4元、1元和16元。实际价格会随官方调整,但输入输出分开、缓存命中更便宜、推理模型更贵的结构长期稳定。一次请求的成本可用输入token数乘输入单价加输出token数乘输出单价估算。
模型差异直接影响额度消耗。deepseek-chat适合改写、分类、摘要和常规问答,响应快且单价低;deepseek-reasoner在数学、代码和复杂规划上更强,但会生成更长的推理内容,输出token往往成倍增加。AI指导老师在课程设计中若把简单的话术润色交给reasoner,等于用高配模型做低配任务。缓存机制则是另一个关键变量,DeepSeek会对相同前缀的上下文进行自动缓存,系统提示、固定规则和知识库开头越稳定,后续请求命中缓存的概率越高,输入成本可显著下降。新用户赠送额度、活动代金券和充值余额通常有不同有效期,扣费顺序一般优先消耗赠送部分,余额不足时接口会拒绝服务,因此需要提前设置告警。
2. 消耗放大的隐形路径:上下文膨胀与无效重试
很多AI指导老师发现单次对话只花几分钱,月度账单却超出预期,原因常在于上下文膨胀。多轮对话中,每一轮请求都会把此前所有消息重新发送给模型,输入token随轮次近似线性增长。若把学员的作业全文、历史批改记录、课程大纲和社群聊天记录全部保留在会话里,十轮之后每次请求的输入可能从两千token涨到两万token。按deepseek-chat未命中缓存2元/百万tokens计算,两万输入token单次约0.04元,输出若为八百token再增加0.0064元,一百次请求就接近4.6元。单看不多,但多个班级、多个助教账号并行时,成本会快速累积。
检索增强生成也容易制造隐形消耗。为了回答课程相关问题,系统可能把整本教材、数十页PDF或大量FAQ原文塞入提示词,其中大量内容与当前问题无关。更合理的做法是先用关键词、向量检索或本地规则筛出三到五段候选材料,再交给模型总结。无效重试同样值得警惕,网络超时、流式中断、JSON解析失败后若不加退避地立即重发,模型可能已经完成生成并计费,重复请求会造成双倍甚至多倍消耗。错误处理应记录请求ID与响应状态,区分未收到响应和收到但解析失败,后者优先修复解析逻辑,而不是直接重试。缓存命中也会被破坏,只要系统提示中插入时间戳、随机ID或学员姓名,前缀发生变化,原本可复用的缓存就会失效。
3. 省钱攻略的工程化落地:提示词、缓存与调用参数
省钱不是单纯减少使用次数,而是把成本控制写进提示词和调用参数。最直接的动作是稳定前缀,把角色设定、输出格式、安全规则和通用知识放在系统提示中,并保持完全一致;把学员姓名、题目编号、临时数据放在用户消息后部。这样DeepSeek的上下文缓存更容易命中,输入单价可从2元/百万tokens降到0.5元/百万tokens。系统提示应避免动态内容,例如当前时间是2025年某月某日这类字段会破坏缓存,可以改由用户消息传入。对于长文档问答,先把文档切片并建立索引,每轮只注入最相关的片段,能显著降低输入token。
调用参数也需要精细化。max_tokens应根据任务设置上限,批改短句不必留两千token输出空间,FAQ回答可以限制在三百token以内;stop序列能避免模型生成多余客套话;温度、top_p在事实问答和格式转换任务中可调低,减少无效输出。批量任务可以合并请求,例如一次让模型处理五道选择题的解析,比五次单独调用节省重复的系统提示和上下文开销。模型路由同样重要,分类、抽取、改写和简单答疑走deepseek-chat,只有数学证明、复杂代码调试和长链规划才走deepseek-reasoner。有AI指导老师将社群FAQ机器人改为固定系统提示加检索片段后置加max_tokens限制后,缓存命中率提升,月度token成本从约两百元降到六十元,响应速度反而更稳定。
在工程层面还可以做预处理与压缩。把重复问题合并,用本地脚本去掉HTML标签、页眉页脚和空白字符;对长会话生成滚动摘要,只保留最近几轮原文和较早对话的要点;对批量作业先按规则打分,只把低置信度样本交给大模型复核。这些做法不会降低教学质量,反而能减少模型在无关信息上的注意力消耗。预算阈值也应前置,例如为每个课程项目设置每日token上限,达到百分之八十时提醒,达到上限后切换低配模型或进入人工审核队列。省钱的本质是让每一次token消耗都对应明确的教学价值,而不是让模型在冗余上下文里反复阅读相同内容。
4. AI指导老师场景的预算管理与监控体系
AI指导老师的额度管理需要从个人习惯升级为项目制度。开放平台控制台通常提供用量统计和账单明细,团队应把API Key按项目、课程或学员分组,至少区分测试环境和生产环境。测试环境使用低额度Key,生产环境单独限额,避免调试脚本误调用高成本模型。每日或每周导出用量数据,按模型、接口、项目打标签,找出消耗最高的提示词和调用方。若发现某个作业批改流程占用总成本的四成,就优先优化该流程的上下文长度、缓存策略和模型选择。余额告警、赠送额度到期提醒和并发限流设置应成为标准配置,防止活动期间流量突增导致服务中断。
具体预算可以按场景估算。假设一名AI指导老师每天处理一百次课程答疑,每次输入三千token、输出五百token,使用deepseek-chat且缓存未命中,输入成本为3000乘2除以一百万等于0.006元,输出成本为500乘8除以一百万等于0.004元,单次约0.01元,每天约1元;若缓存命中,输入成本降至0.0015元,单次约0.0055元,每天约0.55元。同样请求若全部交给deepseek-reasoner,输入成本为0.012元,输出成本为0.008元,单次约0.02元,每天约2元。差距看似只有一倍多,但在批量作业批改、直播课实时问答和数千人社群中,模型路由与缓存策略会决定月度预算是否可控。
团队还应建立复盘机制,把高频提示词、失败重试、缓存命中率和单次任务成本纳入周会看板。对于重复出现的学员问题,沉淀为结构化FAQ并放入检索库,减少模型即兴生成;对于需要深度推理的案例,保留reasoner调用并记录输出质量,避免为了省钱牺牲关键教学体验。新助教上岗前应接受额度规则培训,理解输入输出计费、缓存前缀、max_tokens和重试退避,知道哪些操作会触发高额消耗。周会看板保留缓存命中率、重试率和单次任务成本三个字段,连续两周异常时再调整模型路由。

