English

模型站

三思 · 让 DeepSeek 再聪明一点的 MoA 模型

同一个 DeepSeek V4 Flash,先做、再审、有缺陷才改,外加机械闸门。多花 1–2 倍时间、2–3 倍成本,换来在难题上明显更稳的答案。

我们为什么做它

DeepSeek 的 API 我们用得起,但我们还希望它再聪明、再高效一点。哪怕多等一倍、多付两倍,只要难题的通过率真的上去。三思就是我们自己要用的模型。

调优过程与结果(2026-10-02 实测,可复现)

  • 题目:7 道单模型会丢分的真实编辑工单(路径矛盾、受控执行、测试补全、仓库级改动),每种配置各跑 8 次,共 56 次;用客观检验器判分(路径精确、写范围、语法检查、测试通过),不靠人看。
  • 基线:DeepSeek V4 Flash 直连,推理强度 max:41/56(73%)。
  • 第一版「三问」(事实/推论/下一步):闸门前 41/56,与基线持平;只在题面自相矛盾的题上有优势(14/16 对 9/16),但新增了「正文为空」的失败。
  • v2「做→审→改」加机械闸门:50/56(89%),对基线 p=0.026。审改净贡献 +4(救回 6、改坏 2),闸门 +3(空输出或自称 JSON 却解析失败时带错误位置让模型重交,最多两次,触发的 7–9 次全部修成)。
  • 代价:中位耗时与花费约 1.8 倍。
  • 推理强度:正常题上 low 与 max 一样好且时间花费不到一半;只有题面自相矛盾时 max 更稳。所以三思缺省 high、四档可选。

调优日志

按「你期待的 → 我们做到了没 → 证据」写,结论只用三个词:做到了 / 部分做到 / 没做到。数字来自同一套可复现基准(7 道真实编辑工单 × 8 次)。

你期待的增益结论证据(2026-10-02 基准)
一次给对,少返工做到了一次通过率 73% → 89%(41/56 → 50/56),差异显著(p=0.026)
别把我要的 JSON / 格式弄坏做到了自称 JSON 却解析失败、或输出为空的情况,自动带错误位置让模型重交(最多两次);基准里触发的 7–9 次全部修成
别自作主张停下来反问我「要不要执行」做到了第一版「三问」会在第三轮把执行变成建议并反问;v2 改成「做→审→有缺陷才改」后,这类失败在基准里为 0
题目自相矛盾时别瞎猜部分做到自相矛盾题 max 强度 5/8 对基线 1/8;但这类题仍不是 8/8,我们还在加样例
别慢到没法用部分做到中位耗时约 1.8 倍;长任务最长一例接近 15 分钟。实时对话场景请用直连
别贵到离谱做到了按你看得见的 token 计费,约为直连价的 3 倍;内部的审与改不另收费
新模型出来别让我落后做到了(机制)新底座一出就跑同一基准;直连分数不低于三思就换底座,页面同步更新
用我的真实任务来改进,而不是只用你们的题做到了(机制,默认关)你勾选后,只采样失败样例,脱敏、90 天、随时可删;两周一轮进基准题库

每次调优后在这张表下追加一行日期记录:改了什么、哪几行结论变了、新数字。

适合什么,不适合什么

适合需要一次给对的任务:代码修改提案、结构化 JSON 输出、带约束的改写、审稿式问答。

不适合聊天、极短问答、对延迟敏感的实时场景,这些请用 DeepSeek V4 Flash 直连。

我们的承诺

  • 随时测试最新模型:新模型一出,同一套基准重跑,基线更强就换底座。
  • 持续调优:速度与性价比并重的 MoA(Mixture of Agents)编排,每次改动都有基准数字,页面上公开。
  • 用你的任务来调:在你同意的前提下,把失败样例抽象成新的基准题,下一轮调优针对真实用法。

怎么用

OpenAI 兼容,model 填 deepseek-flash-three-pass。reasoning_effort 可选 low、medium、high、max,max_tokens 缺省 65,536。响应头带每轮耗时与 token,控制台可看三卡(做/审/改)。

curl https://router.xiaojins.com/v1/chat/completions \
  -H "Authorization: Bearer $XJP_KEY" -H "content-type: application/json" \
  -d '{
    "model": "deepseek-flash-three-pass",
    "reasoning_effort": "high",
    "messages": [{"role": "user", "content": "Hello"}]
  }'

价格详情与申请 API key快速开始