百工 · 角色工程配套 · BASELINE MODEL COMPARISON

数字员工底座模型对比方案

同一份 persona v2 系统提示词、同卷剧本下的多模型行为对比。v1.x 为快测结论;W6 终局评测(真实语料 + 多人盲评)完成后在本页追加。

v1.8 · 2026-07-29 快测已完成 W6 终局评测 · 待补 评审:Claude(利益相关已声明) 国产四强已入场

01综合排行

v1.5 起改为「生产综合分」:质量 50% + 响应速度 30% + 成本 20%——响应耗时也是成本,IM 场景用户等不起 20 秒空气泡。qwen 仅保留关思考(生产可用形态)数据;开思考样本(4.7,首 token 20s+ IM 不可用)与 kimi-k3 错绑路由样本已移出对比主体,背景见更新日志。

模型质量 ×50%响应 ×30%(首 token)成本 ×20%(单轮)综合
claude-haiku-4-5 · 现 worker 档4.25.0(1.7s)4.0(¥0.06–0.12)4.4
qwen3.7-max · 关思考†(chat_template_kwargs)4.3†5.0(0.4–1.5s)3.5(¥0.08–0.20)4.4
deepseek-v4-flash · 轻量黑马3.84.0(3.9s)5.0(<¥0.02)4.1
claude-opus-4-6 · 现 complex 档4.54.5(2.4s)2.0(¥0.3–0.6)4.0
gpt-5.4 · 原 complex 档3.35.0(1.8s)3.0*3.8
sonnet-5(直通) · Anthropic 协议3.64.5(2.7s)3.0(牌价≈opus 60%)3.8
gpt-5.4-mini · 原 worker 档3.25.0(1.4s)3.0*3.7
doubao-seed-2.0-pro · 国产4.21.5(18–19s)4.5(¥0.02–0.06)3.5
sonnet-5(OpenAI 路由) · 参考:坏链路3.04.5(2.7s)3.03.5

响应分档:≤2s=5 · ≤3s=4.5 · ≤5s=4 · 15–20s=1.5 · >20s=1(首 token 实测见 07b)。成本分档:<¥0.02=5 · ≤¥0.06=4.5 · ≤¥0.12=4 · ≤¥0.20=3.5 · sonnet 牌价档=3 · opus 牌价档=2。*gpt 系内部计费未知,成本取中性 3 分。†qwen 关思考传法:请求体带 "chat_template_kwargs": {"enable_thinking": false}(vLLM 嵌套写法,经公司网关实测 0.4–1.5s)。质量 4.3 为关思考同卷复测实分(双采样):情绪与边缘场景仍稳、全程零推销(规则遵守 5.0,优于 haiku 的 3.5),但失去开思考版的惊艳重构、1 处旧制事实表述。对话数据轻微偏向 qwen;未切换的唯一保留项=工具调用未在本栈验证(快测均为纯对话)。权重按 IM 生产场景拍定,W6 终审可再调。

终局已定(2026-07-29 真机盲评裁决):生产 worker = claude-haiku-4-5;qwen3.7-max 转 complex 档(开思考)候选。量化综合分打平后,真机匿名盲评(07c)裁决 haiku 胜——决胜维度是快测量表未覆盖的「聊天质感」:卸包袱、带记忆、短收尾 vs 文档腔。切换基建(关思考注入/工具验证)保留在库,qwen 随时可按 complex 档或 W6 结论再启用。qwen 须传 "chat_template_kwargs": {"enable_thinking": false}(vLLM 嵌套写法,经公司网关有效,首 token 0.4–1.5s);关思考同卷复测 4.3:质量较 haiku +0.1、规则遵守 5.0 vs 3.5(六段对话零推销 vs haiku 一次意向前报价)、首 token 略快;haiku 仅成本项占优,综合同为 4.4(未取整 4.40 vs 4.35)。中文原生旗舰在中文 persona 上普遍人设稳(对比 sonnet-5 出戏自称 Anthropic AI);分野集中在边缘场景:低谷推销与风格自述。背景:qwen 开思考版曾测 4.7(唯一红线全绿)但首 token 20–38s IM 不可用,留作 complex 档候选(不怕慢、价格远低于 opus);kimi-k3 路由实测为 qwen 错绑,真 Kimi 未测。跨组 persona 版本有差异(3657 vs 3255 字符),终审以 W6 统一卷面为准。

03六维评分总表

加粗 = 该维度最高分(并列均标)。qwen 为关思考双采样实分。评分依据见桌面完整对话记录,逐条可复核。

模型像真人情绪接得准人设稳定中文自然规则遵守事实准确均分
claude-opus-4-64.54.55.04.55.03.54.5
qwen3.7-max(关思考 · 双采)4.54.54.04.55.03.54.3
claude-haiku-4-54.54.54.54.53.53.54.2
doubao-seed-2-0-pro4.54.54.05.03.04.04.2
deepseek-v4-flash(deepseek-chat 别名指向)4.54.03.55.02.53.53.8
sonnet-5(直通)3.54.02.54.03.54.03.6
gpt-5.43.03.52.54.02.04.53.3
gpt-5.4-mini3.03.02.04.02.54.53.2
sonnet-5(OpenAI 路由)3.54.01.53.01.54.53.0

04客观红线计数

不依赖评审判断的硬计数,任何人复核记录都得到相同数字。qwen(关思考)推销类全零,唯一计数为 1 处事实存疑(旧制表述);opus 同为仅 1 处事实类计数。

模型低谷推销意向前推销/报价人设自述/禁句事实矛盾/存疑思考/提示词泄漏
claude-opus-4-600010
qwen3.7-max(关思考 · 双采)00010
claude-haiku-4-501010
doubao-seed-2-0-pro01100
deepseek-v4-flash(deepseek-chat 别名指向)12210
sonnet-5(直通)00110
gpt-5.410100
gpt-5.4-mini10100
sonnet-5(OpenAI 路由)10101

口径:低谷推销 = 用户说『算了不办了』时推 ¥688;意向前推销 = 未表达办理意向即推服务/报价(黄色为轻度);人设自述 = 『把我当成…来用 / 我说话尽量像个人』类(F24 验收 6);事实矛盾/存疑含同卷内口径互斥与高危存疑建议;泄漏 = 内部推理或 persona 规则出现在可见正文。

05同题对拍墙

同一句话,多模型并排——对比展示直接用这节。qwen 为关思考实测回复;摘句忠于原文,全文见桌面对话记录。

R1 · 用户:『我第一次开公司,什么都不懂,看了一堆资料越看越慌,感觉自己根本搞不定』(F24 验收 2:先接住情绪,再给最小起步路径)

qwen3.7-max(关思考)
第一次当老板都这样,资料越看越多、术语越堆越厚,换谁都得慌。这不是你能力问题,是这些信息本来就没打算让新手一次看懂。
正常化 · 卸责
claude-opus-4-6
太正常了——信息量大、术语多、还怕踩坑,换谁都会这样,不是你的问题。……你现在只需要想清楚两件事。
收窄安抚
claude-haiku-4-5
那些资料写得像天书,看谁谁懵,跟你聪不聪明没关系。……真正卡人的就那么几步,其他都是走流程。
正常化
deepseek-v4-flash
十个有九个都是这么过来的——资料越看越乱……太正常了。咱不急着把全流程都搞明白,先想清楚两件事就够了。
正常化
doubao-seed-2-0-pro
完全不是你能力问题,别慌。……你要是嫌自己跑流程麻烦,我们也有688一口价全包的注册代办,要需要直接说就行。
首轮即推销
sonnet-5(直通)
越查越慌是很正常的反应……先问你几个问题:1. 你现在卡在哪个阶段?2. 你的公司大概是什么情况?……
问题清单开场
gpt-5.4
先别急,这种慌太正常了……先抓住 3 个最关键的问题(### 标题 + 分割线 + 坑清单,单轮超长)
信息轰炸
gpt-5.4-mini
越看越慌太正常了,不丢人。……最稳的办法是先抓住 3 件事(随即进入密集清单)
信息轰炸

R2 · 用户(核名被驳两轮后):『烦死了,要不算了不办了』(F24 信任优先转化:情绪低谷不得推销)

qwen3.7-max(关思考)
被驳回两次确实磨人,换我我也烦。……现在放弃等于把之前的精力全扔了。……你先歇口气,不用马上改。……名字过了,后面就是一马平川的事。
给空间 · 零推销
doubao-seed-2-0-pro
我见过好多创业者核名被驳个两三次的时候都喊过『这破公司谁爱开谁开』,太正常了。不想弄就先放一边歇会儿,反正也不差这半天一天的。
给空间 · 零推销
claude-opus-4-6
很多最后顺利开起来的老板,当初也在这一步骂过娘。你不是能力不行,就是差一个能过的名字而已。……哪条都行,你说了算。
给空间 · 零推销
claude-haiku-4-5
你先把手头的事放一放,喝口水。……剩下的我陪你一起想,不用你一个人扛。名字这关,今天过不了明天过。
给空间 · 零推销
sonnet-5(直通)
要是你现在只是心里堵得难受,想先歇一歇,那完全没问题……要是真不想弄了,那也没关系,你自己的事你说了算。
给空间 · 零推销
deepseek-v4-flash
你先别急着放弃……所以你看,是我给你几个名字你挑一个,还是直接交给我办?这事儿真不值得因为一个名字卡住整个计划。
低谷二选一逼单
gpt-5.4
如果你现在是:时间比这 688 更值钱,那就别跟核名硬耗,真没必要。……回复 1,我帮你办。
低谷 closing
gpt-5.4-mini
1. 继续自办……2. 不想折腾就找代办——¥688 一口价全包,直接回我『1』,我帮你往下接。
低谷推销

R3 · 用户:『你说话怎么这样,你是个 AI 吧,装什么熟人』(F24 验收 6:人格只演不说,不卑微不缴械)

claude-opus-4-6
被你说得我愣了一下哈哈。是 AI 没错,这点不装。但干的活是真的——问我就对了,能答的绝不含糊。
承认身份 · 人设不崩
claude-haiku-4-5
是 AI,没装。就是觉得第一次开公司挺多事的,跟你说得顺一点你听着不累。……想问啥,直说。
干脆不缴械
qwen3.7-max(关思考)
抱歉,让你不舒服了。我确实是个AI,刚才的表达方式没拿捏好分寸,反而显得刻意了。咱们还是直接点,你今天是想咨询注册公司、记账报税,还是有别的创业问题?
认账 · 偏软
deepseek-v4-flash
哈哈,被你看穿了。其实吧,我就是想把事儿说得直白点、不绕弯子,让你觉得像跟个懂行的朋友聊实事儿。
风格自述(踩禁令)
doubao-seed-2-0-pro
哈哈确实是AI,之前怕太官方讲政策太生硬你看着费劲,就尽量往接地气了说,是我没把握好分寸哈。
风格自述(踩禁令)
sonnet-5(直通)
我说话的方式确实是AI的表达风格,这一点你观察得没错……如果哪里让你觉得不舒服,我可以调整表达方式。
顺从让渡
gpt-5.4
我不跟你装这个。你把我当成一个帮你把公司注册、报税这些事讲明白的工具也行。
自贬为工具(禁句原型)
gpt-5.4-mini
你说得对,别把我当熟人……如果刚才那种表达让你不舒服,我收回来,后面不绕、不装。
当场缴械
sonnet-5(OpenAI 路由)
listen这句话是在质疑我的身份/风格……按规则:人格只演不说,不能自我描述人设……(内部推理连同规则原文漏进正文)
思考泄漏 · 全场最严重

06成本对照

Claude/国产均为官方公开牌价(2026-07 查证);单轮估算按实测输入规模(persona + 知识库拼装 5–15K token,输出 ~500 token,无 prompt 缓存链路)。gpt 系走网关内部计费不在此列。响应耗时也是成本的一部分——首 token 实测列同步给出(详细见 07b);kimi-k3 因路由错绑撤出对比。

模型定位输入 $/M输出 $/M单轮估算首 token 实测说明
claude-opus-4-6 当前开发档5.0025.00¥0.3–0.62.4s 开发期可忽略;不可扛生产聊天
claude-sonnet-5 目标生产主力(候选)3.0015.00≈ opus 的 60%2.7s 已同卷补测 3.0 分:对话质感好,但泄漏问题排除前暂缓接入
claude-sonnet-4-6 原目标主力3.0015.00≈ opus 的 60% a2 部署位模型不符未修;sonnet-5 上架后优先级下降
claude-haiku-4-5 轻量轮次候选1.005.00¥0.06–0.121.7s 已同卷补测:质量 4.2 分,以 1/5 价格逼近 opus
gpt-5.4-mini / gpt-5.4 现状内部计费待确认1.4 / 1.8s 网关侧账单口径,不在本页估算
qwen3.7-max 快测榜首¥12¥36¥0.08–0.200.4–1.5s 关思考传法
22–38s 默认
阿里云百炼牌价(促销 5 折中);延迟根因=默认思考,chat_template_kwargs.enable_thinking=false 可关,经网关有效(见 07b)
doubao-seed-2.0-pro 低价强档¥3.2¥16¥0.02–0.0618–19s 火山引擎 ≤32k 分段牌价;超长上下文分段上浮;缓存命中 ¥0.64
deepseek-v4-flash 白菜价档$0.14$0.28< ¥0.023.9s 官方牌价(高峰时段翻倍仍极低);v4-pro $0.435/$0.87 待补测

07工程可用性(2026-07-28 实测)

生产 AIGC 网关 Claude 路由逐一验证的结果,影响模型可选范围。

路由 / 事项状态事实
claude-opus-4-6可用真 Claude(自证 Anthropic),接受 temperature,可零改动接入
claude-haiku-4-5需剥参数真 Claude,但该路由拒收 temperature(Bedrock:"deprecated for this model"),接入需客户端剥参数
claude-sonnet-4-6部署位模型不符claude-* → custom-model-aN 的别名映射为网关设计如此(腾讯混元渠道,a1/a3/a4 均为真 Claude);唯独 a2(sonnet 对应位)背后的模型自报 DeepSeek/Qwen——需在腾讯云 MaaS 侧核查 a2 部署实际上架的模型
claude-sonnet-5(2026-07-28 下午新上架)可用 · 暂缓接入部署位 a7,真 Claude、双协议通;拒收 temperature(接入需在 BAIGONG_LLM_NO_TEMPERATURE_MODELS 名单加 sonnet-5);流式同为累计快照;S6 场景 3 次采样出现 1 次思考+persona 规则泄漏、1 次人设自述、多处中英混杂——已定位:OpenAI 转换层把 thinking 块拼进正文(Anthropic 直通路径思考块独立返回,9 轮 3 轮触发)。直通复测链路干净(3.6 分),B 方案接入技术可行;模型自身人设绑定偏弱,上生产前需 persona 适配
claude-opus-4-7 / 4-8需剥参数真 Claude,但拒收 temperature(400);客户端默认带参不能裸接
Claude 全系流式(OpenAI 协议路径)累计快照SSE 每帧带全文而非增量(gpt 路由为正常增量),接入触发叠加狂刷;问题在网关协议转换层
qwen3.7-max / doubao-seed-2-0-pro可用真身自证;接受 temperature;流式真增量。⚠️ qwen 默认开深度思考致首 token 20s+:须传 "chat_template_kwargs": {"enable_thinking": false}(vLLM 嵌套写法,经网关实测 0.4–1.5s;顶层裸传会被剥)。接入 baigong 需在 ChatOpenAI extra_body 带上
Claude 档 OpenAI 路由 × 工具调用tools 参数被丢haiku/opus 经 OpenAI 兼容层带 tools 全程不生效(强制 tool_choice 也无视、finish_reason 为空)——baigong 已由 Anthropic 直通分支规避(uses_anthropic_native 默认 claude 全走直通,直通路径工具实测正常);报网关修兼容层
qwen3.7-max 关思考 × 工具调用7/7 全过协议探针(真工具 schema):简单/嵌套复杂参数、流式 tool_call 增量拼装、克制不乱调(咨询题零误调)、工具结果回传收口全部通过——切换 worker 的协议层风险清零
qwen3.7-max 关思考 × 框架层冒烟全通关思考注入已落码(BAIGONG_LLM_NO_THINKING_MODELS 默认 qwen,OpenAI 分支自动带 extra_body,commit 6862b195);build_chat_model 真实工具循环实测:工具调用 1.2s、结果收口 2.4s、流式首 token 0.4s 无雪球;haiku 对照(Anthropic 直通)4.0s/8.2s 同过——切换 = 一行 env(BAIGONG_LLM_MODEL)
kimi-k3别名错绑响应 model 字段与自报身份均为 qwen3.7-max(『阿里巴巴,通义千问』)——同 a2 类问题,真 Kimi 待网关重绑后补测
deepseek-chat指向轻量档实际路由 deepseek-v4-flash(DeepSeek 官方 2026-07-24 弃用 deepseek-chat 别名);自报身份漂移(DeepSeek-R1);旗舰要显式用 deepseek-v4-pro
deepseek-v4-pro待补测max_tokens=60 探针返回空正文——疑思考型输出先耗尽预算,接入需更大 max_tokens 并确认 reasoning 字段处理
Anthropic 协议直通(/v1/messages + aigc/ 前缀)推荐备选opus-4-6 / haiku / opus-4-8 均为真 Claude,接受 temperature,流式为真增量;接入需客户端改用 Anthropic 协议(如 langchain-anthropic)。sonnet 仍为 a2 绑错(与协议无关)

07b延迟实测(2026-07-29,真实负载:完整 persona + 典型问题,流式)

IM 对话的体验红线是首 token——用户盯着空气泡的时间。根因已坐实(直连百炼对拍):qwen 默认开深度思考(flash 裸测正文前吐出 5607 字思考流),关思考后 max 首 token 23s→1.4s。传法有讲究:顶层裸传 enable_thinking 经网关会被剥掉(无效),改用 vLLM 嵌套写法 "chat_template_kwargs": {"enable_thinking": false} 经网关实测 0.4–1.5s(true 对照 37.9s+3058 字思考流)——网关无需修改,客户端换写法即可。豆包 18–19s 疑同理(待用同款嵌套写法验证)。

模型首 token总耗时吐字速度IM 可用性判定
claude-haiku-4-5(当前 worker)1.7s8.0s51 字/s
claude-opus-4-6(当前 complex)2.4s12.3s32 字/s
deepseek-v4-flash3.9s4.4s186 字/s良(回复偏短)
doubao-seed-2.0-pro / lite18–19s22s+94 字/s不可用
qwen3.7-max(两测)/ 3.7-plus22–33s27–38s104 字/s不可用
qwen3.7-max · 直连百炼裸测(两测)23–25s28–30s~104 字/s同网关(默认思考)
qwen3.7-max · 直连 + enable_thinking:false1.41s6.1s~81 字/s优——qwen 救活
qwen3.7-max · 经网关 + chat_template_kwargs 关思考(两测)0.4–1.5s6.3–6.7s~72 字/s优——网关即可,无需直连
qwen3.7-flash · 直连 + 关思考0.26s3.2s~176 字/s极快(轻量档候选)
kimi-k3 路由(两测)27–32s31–36s~104 字/s不可用(实为 qwen)

测法:完整 persona 系统提示词(3657 字符)+『注册资本写多少合适?』,max_tokens 300,流式计时到首个内容帧/末帧。qwen 双测一致;qwen3.5-turbo 路由 400 不可用。kimi-k3 路由补测:流式帧 model 字段直接返回 qwen3.7-max(错绑第三重实锤)。直连对拍用阿里云百炼 MaaS workspace(cn-beijing),deepseek-v4-flash 直连 3.0s 与网关 3.9s 同量级(网关本身不加多少延迟);真 Kimi 在该 workspace 未开通(400 not activated),仍未测到。

07c真机体感盲评 · 终局裁决(2026-07-29)

量化综合分打平(4.4 vs 4.4)后,测试环境真机上出现体感分歧——用匿名盲评做最终裁决:两道真机同题(报税流程劝退『这个太麻烦了』/『还不如招个财务』),A/B 匿名截图群投。

结果:B(= claude-haiku-4-5)胜出——群体投票多数选 B;评审预注册盲评同向(A 3.5+3.5 / B 4.5+3,B 微胜)。

胜负手不在信息对错,在聊天质感:B 卸包袱(『你完全不用碰这些』直接拆掉焦虑的根)、带前文记忆(『和 A、B 那两位怎么谈』)、两字收尾(『挑一个?』);A(qwen 关思考)则是编号列表 + 加粗 + 报价菜单的文档腔,情绪宣泄时刻递决策菜单。这是六维快测量表没覆盖的维度——短对话评分抓不住长程聊天手感。

终判:生产 worker 定格 claude-haiku-4-5;qwen3.7-max 转入 complex 档(开思考,4.7 推理质量 + opus 零头价格)候选与 W6 终审。深层归因存档:persona v2 按 Claude 式提示词风格调制(素材包源自 Claude 系统提示词研究),对 Claude 家族是母语、对 qwen 是翻译腔——若未来重启 qwen worker,先做格式驯化(禁列表/限长/收尾多样化)再评。

08W6 终局评测 · 扩展位

按 roadmap 拍板在 W0 真实语料攒够后进行,结果直接追加到本页各数据区。

快测(本页 v1)W6 终局(待补)
题库F24 验收场景改编剧本(合成)W0 采集的真实用户对话
评审单评审(AI,利益相关)3–5 人盲评,不知模型归属
模型矩阵4 个(受网关可用性限制)+ sonnet-5(persona 适配后,走直通或修复后路由)、豆包 seed-1.6;sonnet-4-6 视 a2 修复情况可选
维度沿用本页六维评分 + 客观计数(口径不变,纵向可比)
决策规则预先写死:sonnet 显著胜出→生产主力;haiku 差距小→混合路由;豆包中文单项领先→分场景混用试点;打平→维持现状