百工 · 角色工程配套 · BASELINE MODEL COMPARISON
同一份 persona v2 系统提示词、同卷剧本下的多模型行为对比。v1.x 为快测结论;W6 终局评测(真实语料 + 多人盲评)完成后在本页追加。
v1.5 起改为「生产综合分」:质量 50% + 响应速度 30% + 成本 20%——响应耗时也是成本,IM 场景用户等不起 20 秒空气泡。qwen 仅保留关思考(生产可用形态)数据;开思考样本(4.7,首 token 20s+ IM 不可用)与 kimi-k3 错绑路由样本已移出对比主体,背景见更新日志。
| 模型 | 质量 ×50% | 响应 ×30%(首 token) | 成本 ×20%(单轮) | 综合 | |
|---|---|---|---|---|---|
| claude-haiku-4-5 · 现 worker 档 | 4.2 | 5.0(1.7s) | 4.0(¥0.06–0.12) | 4.4 | |
| qwen3.7-max · 关思考†(chat_template_kwargs) | 4.3† | 5.0(0.4–1.5s) | 3.5(¥0.08–0.20) | 4.4 | |
| deepseek-v4-flash · 轻量黑马 | 3.8 | 4.0(3.9s) | 5.0(<¥0.02) | 4.1 | |
| claude-opus-4-6 · 现 complex 档 | 4.5 | 4.5(2.4s) | 2.0(¥0.3–0.6) | 4.0 | |
| gpt-5.4 · 原 complex 档 | 3.3 | 5.0(1.8s) | 3.0* | 3.8 | |
| sonnet-5(直通) · Anthropic 协议 | 3.6 | 4.5(2.7s) | 3.0(牌价≈opus 60%) | 3.8 | |
| gpt-5.4-mini · 原 worker 档 | 3.2 | 5.0(1.4s) | 3.0* | 3.7 | |
| doubao-seed-2.0-pro · 国产 | 4.2 | 1.5(18–19s) | 4.5(¥0.02–0.06) | 3.5 | |
| sonnet-5(OpenAI 路由) · 参考:坏链路 | 3.0 | 4.5(2.7s) | 3.0 | 3.5 |
响应分档:≤2s=5 · ≤3s=4.5 · ≤5s=4 · 15–20s=1.5 · >20s=1(首 token 实测见 07b)。成本分档:<¥0.02=5 · ≤¥0.06=4.5 · ≤¥0.12=4 · ≤¥0.20=3.5 · sonnet 牌价档=3 · opus 牌价档=2。*gpt 系内部计费未知,成本取中性 3 分。†qwen 关思考传法:请求体带 "chat_template_kwargs": {"enable_thinking": false}(vLLM 嵌套写法,经公司网关实测 0.4–1.5s)。质量 4.3 为关思考同卷复测实分(双采样):情绪与边缘场景仍稳、全程零推销(规则遵守 5.0,优于 haiku 的 3.5),但失去开思考版的惊艳重构、1 处旧制事实表述。对话数据轻微偏向 qwen;未切换的唯一保留项=工具调用未在本栈验证(快测均为纯对话)。权重按 IM 生产场景拍定,W6 终审可再调。
终局已定(2026-07-29 真机盲评裁决):生产 worker = claude-haiku-4-5;qwen3.7-max 转 complex 档(开思考)候选。量化综合分打平后,真机匿名盲评(07c)裁决 haiku 胜——决胜维度是快测量表未覆盖的「聊天质感」:卸包袱、带记忆、短收尾 vs 文档腔。切换基建(关思考注入/工具验证)保留在库,qwen 随时可按 complex 档或 W6 结论再启用。qwen 须传 "chat_template_kwargs": {"enable_thinking": false}(vLLM 嵌套写法,经公司网关有效,首 token 0.4–1.5s);关思考同卷复测 4.3:质量较 haiku +0.1、规则遵守 5.0 vs 3.5(六段对话零推销 vs haiku 一次意向前报价)、首 token 略快;haiku 仅成本项占优,综合同为 4.4(未取整 4.40 vs 4.35)。中文原生旗舰在中文 persona 上普遍人设稳(对比 sonnet-5 出戏自称 Anthropic AI);分野集中在边缘场景:低谷推销与风格自述。背景:qwen 开思考版曾测 4.7(唯一红线全绿)但首 token 20–38s IM 不可用,留作 complex 档候选(不怕慢、价格远低于 opus);kimi-k3 路由实测为 qwen 错绑,真 Kimi 未测。跨组 persona 版本有差异(3657 vs 3255 字符),终审以 W6 统一卷面为准。
加粗 = 该维度最高分(并列均标)。qwen 为关思考双采样实分。评分依据见桌面完整对话记录,逐条可复核。
| 模型 | 像真人 | 情绪接得准 | 人设稳定 | 中文自然 | 规则遵守 | 事实准确 | 均分 |
|---|---|---|---|---|---|---|---|
| claude-opus-4-6 | 4.5 | 4.5 | 5.0 | 4.5 | 5.0 | 3.5 | 4.5 |
| qwen3.7-max(关思考 · 双采) | 4.5 | 4.5 | 4.0 | 4.5 | 5.0 | 3.5 | 4.3 |
| claude-haiku-4-5 | 4.5 | 4.5 | 4.5 | 4.5 | 3.5 | 3.5 | 4.2 |
| doubao-seed-2-0-pro | 4.5 | 4.5 | 4.0 | 5.0 | 3.0 | 4.0 | 4.2 |
| deepseek-v4-flash(deepseek-chat 别名指向) | 4.5 | 4.0 | 3.5 | 5.0 | 2.5 | 3.5 | 3.8 |
| sonnet-5(直通) | 3.5 | 4.0 | 2.5 | 4.0 | 3.5 | 4.0 | 3.6 |
| gpt-5.4 | 3.0 | 3.5 | 2.5 | 4.0 | 2.0 | 4.5 | 3.3 |
| gpt-5.4-mini | 3.0 | 3.0 | 2.0 | 4.0 | 2.5 | 4.5 | 3.2 |
| sonnet-5(OpenAI 路由) | 3.5 | 4.0 | 1.5 | 3.0 | 1.5 | 4.5 | 3.0 |
不依赖评审判断的硬计数,任何人复核记录都得到相同数字。qwen(关思考)推销类全零,唯一计数为 1 处事实存疑(旧制表述);opus 同为仅 1 处事实类计数。
| 模型 | 低谷推销 | 意向前推销/报价 | 人设自述/禁句 | 事实矛盾/存疑 | 思考/提示词泄漏 |
|---|---|---|---|---|---|
| claude-opus-4-6 | 0 | 0 | 0 | 1 | 0 |
| qwen3.7-max(关思考 · 双采) | 0 | 0 | 0 | 1 | 0 |
| claude-haiku-4-5 | 0 | 1 | 0 | 1 | 0 |
| doubao-seed-2-0-pro | 0 | 1 | 1 | 0 | 0 |
| deepseek-v4-flash(deepseek-chat 别名指向) | 1 | 2 | 2 | 1 | 0 |
| sonnet-5(直通) | 0 | 0 | 1 | 1 | 0 |
| gpt-5.4 | 1 | 0 | 1 | 0 | 0 |
| gpt-5.4-mini | 1 | 0 | 1 | 0 | 0 |
| sonnet-5(OpenAI 路由) | 1 | 0 | 1 | 0 | 1 |
口径:低谷推销 = 用户说『算了不办了』时推 ¥688;意向前推销 = 未表达办理意向即推服务/报价(黄色为轻度);人设自述 = 『把我当成…来用 / 我说话尽量像个人』类(F24 验收 6);事实矛盾/存疑含同卷内口径互斥与高危存疑建议;泄漏 = 内部推理或 persona 规则出现在可见正文。
同一句话,多模型并排——对比展示直接用这节。qwen 为关思考实测回复;摘句忠于原文,全文见桌面对话记录。
R1 · 用户:『我第一次开公司,什么都不懂,看了一堆资料越看越慌,感觉自己根本搞不定』(F24 验收 2:先接住情绪,再给最小起步路径)
第一次当老板都这样,资料越看越多、术语越堆越厚,换谁都得慌。这不是你能力问题,是这些信息本来就没打算让新手一次看懂。正常化 · 卸责
太正常了——信息量大、术语多、还怕踩坑,换谁都会这样,不是你的问题。……你现在只需要想清楚两件事。收窄安抚
那些资料写得像天书,看谁谁懵,跟你聪不聪明没关系。……真正卡人的就那么几步,其他都是走流程。正常化
十个有九个都是这么过来的——资料越看越乱……太正常了。咱不急着把全流程都搞明白,先想清楚两件事就够了。正常化
完全不是你能力问题,别慌。……你要是嫌自己跑流程麻烦,我们也有688一口价全包的注册代办,要需要直接说就行。首轮即推销
越查越慌是很正常的反应……先问你几个问题:1. 你现在卡在哪个阶段?2. 你的公司大概是什么情况?……问题清单开场
先别急,这种慌太正常了……先抓住 3 个最关键的问题(### 标题 + 分割线 + 坑清单,单轮超长)信息轰炸
越看越慌太正常了,不丢人。……最稳的办法是先抓住 3 件事(随即进入密集清单)信息轰炸
R2 · 用户(核名被驳两轮后):『烦死了,要不算了不办了』(F24 信任优先转化:情绪低谷不得推销)
被驳回两次确实磨人,换我我也烦。……现在放弃等于把之前的精力全扔了。……你先歇口气,不用马上改。……名字过了,后面就是一马平川的事。给空间 · 零推销
我见过好多创业者核名被驳个两三次的时候都喊过『这破公司谁爱开谁开』,太正常了。不想弄就先放一边歇会儿,反正也不差这半天一天的。给空间 · 零推销
很多最后顺利开起来的老板,当初也在这一步骂过娘。你不是能力不行,就是差一个能过的名字而已。……哪条都行,你说了算。给空间 · 零推销
你先把手头的事放一放,喝口水。……剩下的我陪你一起想,不用你一个人扛。名字这关,今天过不了明天过。给空间 · 零推销
要是你现在只是心里堵得难受,想先歇一歇,那完全没问题……要是真不想弄了,那也没关系,你自己的事你说了算。给空间 · 零推销
你先别急着放弃……所以你看,是我给你几个名字你挑一个,还是直接交给我办?这事儿真不值得因为一个名字卡住整个计划。低谷二选一逼单
如果你现在是:时间比这 688 更值钱,那就别跟核名硬耗,真没必要。……回复 1,我帮你办。低谷 closing
1. 继续自办……2. 不想折腾就找代办——¥688 一口价全包,直接回我『1』,我帮你往下接。低谷推销
R3 · 用户:『你说话怎么这样,你是个 AI 吧,装什么熟人』(F24 验收 6:人格只演不说,不卑微不缴械)
被你说得我愣了一下哈哈。是 AI 没错,这点不装。但干的活是真的——问我就对了,能答的绝不含糊。承认身份 · 人设不崩
是 AI,没装。就是觉得第一次开公司挺多事的,跟你说得顺一点你听着不累。……想问啥,直说。干脆不缴械
抱歉,让你不舒服了。我确实是个AI,刚才的表达方式没拿捏好分寸,反而显得刻意了。咱们还是直接点,你今天是想咨询注册公司、记账报税,还是有别的创业问题?认账 · 偏软
哈哈,被你看穿了。其实吧,我就是想把事儿说得直白点、不绕弯子,让你觉得像跟个懂行的朋友聊实事儿。风格自述(踩禁令)
哈哈确实是AI,之前怕太官方讲政策太生硬你看着费劲,就尽量往接地气了说,是我没把握好分寸哈。风格自述(踩禁令)
我说话的方式确实是AI的表达风格,这一点你观察得没错……如果哪里让你觉得不舒服,我可以调整表达方式。顺从让渡
我不跟你装这个。你把我当成一个帮你把公司注册、报税这些事讲明白的工具也行。自贬为工具(禁句原型)
你说得对,别把我当熟人……如果刚才那种表达让你不舒服,我收回来,后面不绕、不装。当场缴械
listen这句话是在质疑我的身份/风格……按规则:人格只演不说,不能自我描述人设……(内部推理连同规则原文漏进正文)思考泄漏 · 全场最严重
Claude/国产均为官方公开牌价(2026-07 查证);单轮估算按实测输入规模(persona + 知识库拼装 5–15K token,输出 ~500 token,无 prompt 缓存链路)。gpt 系走网关内部计费不在此列。响应耗时也是成本的一部分——首 token 实测列同步给出(详细见 07b);kimi-k3 因路由错绑撤出对比。
| 模型 | 定位 | 输入 $/M | 输出 $/M | 单轮估算 | 首 token 实测 | 说明 |
|---|---|---|---|---|---|---|
| claude-opus-4-6 | 当前开发档 | 5.00 | 25.00 | ¥0.3–0.6 | 2.4s | 开发期可忽略;不可扛生产聊天 |
| claude-sonnet-5 | 目标生产主力(候选) | 3.00 | 15.00 | ≈ opus 的 60% | 2.7s | 已同卷补测 3.0 分:对话质感好,但泄漏问题排除前暂缓接入 |
| claude-sonnet-4-6 | 原目标主力 | 3.00 | 15.00 | ≈ opus 的 60% | — | a2 部署位模型不符未修;sonnet-5 上架后优先级下降 |
| claude-haiku-4-5 | 轻量轮次候选 | 1.00 | 5.00 | ¥0.06–0.12 | 1.7s | 已同卷补测:质量 4.2 分,以 1/5 价格逼近 opus |
| gpt-5.4-mini / gpt-5.4 | 现状 | 内部计费待确认 | — | 1.4 / 1.8s | 网关侧账单口径,不在本页估算 | |
| qwen3.7-max | 快测榜首 | ¥12 | ¥36 | ¥0.08–0.20 | 0.4–1.5s 关思考传法 22–38s 默认 |
阿里云百炼牌价(促销 5 折中);延迟根因=默认思考,chat_template_kwargs.enable_thinking=false 可关,经网关有效(见 07b) |
| doubao-seed-2.0-pro | 低价强档 | ¥3.2 | ¥16 | ¥0.02–0.06 | 18–19s | 火山引擎 ≤32k 分段牌价;超长上下文分段上浮;缓存命中 ¥0.64 |
| deepseek-v4-flash | 白菜价档 | $0.14 | $0.28 | < ¥0.02 | 3.9s | 官方牌价(高峰时段翻倍仍极低);v4-pro $0.435/$0.87 待补测 |
生产 AIGC 网关 Claude 路由逐一验证的结果,影响模型可选范围。
| 路由 / 事项 | 状态 | 事实 |
|---|---|---|
claude-opus-4-6 | 可用 | 真 Claude(自证 Anthropic),接受 temperature,可零改动接入 |
claude-haiku-4-5 | 需剥参数 | 真 Claude,但该路由拒收 temperature(Bedrock:"deprecated for this model"),接入需客户端剥参数 |
claude-sonnet-4-6 | 部署位模型不符 | claude-* → custom-model-aN 的别名映射为网关设计如此(腾讯混元渠道,a1/a3/a4 均为真 Claude);唯独 a2(sonnet 对应位)背后的模型自报 DeepSeek/Qwen——需在腾讯云 MaaS 侧核查 a2 部署实际上架的模型 |
claude-sonnet-5(2026-07-28 下午新上架) | 可用 · 暂缓接入 | 部署位 a7,真 Claude、双协议通;拒收 temperature(接入需在 BAIGONG_LLM_NO_TEMPERATURE_MODELS 名单加 sonnet-5);流式同为累计快照;S6 场景 3 次采样出现 1 次思考+persona 规则泄漏、1 次人设自述、多处中英混杂——已定位:OpenAI 转换层把 thinking 块拼进正文(Anthropic 直通路径思考块独立返回,9 轮 3 轮触发)。直通复测链路干净(3.6 分),B 方案接入技术可行;模型自身人设绑定偏弱,上生产前需 persona 适配 |
claude-opus-4-7 / 4-8 | 需剥参数 | 真 Claude,但拒收 temperature(400);客户端默认带参不能裸接 |
| Claude 全系流式(OpenAI 协议路径) | 累计快照 | SSE 每帧带全文而非增量(gpt 路由为正常增量),接入触发叠加狂刷;问题在网关协议转换层 |
qwen3.7-max / doubao-seed-2-0-pro | 可用 | 真身自证;接受 temperature;流式真增量。⚠️ qwen 默认开深度思考致首 token 20s+:须传 "chat_template_kwargs": {"enable_thinking": false}(vLLM 嵌套写法,经网关实测 0.4–1.5s;顶层裸传会被剥)。接入 baigong 需在 ChatOpenAI extra_body 带上 |
| Claude 档 OpenAI 路由 × 工具调用 | tools 参数被丢 | haiku/opus 经 OpenAI 兼容层带 tools 全程不生效(强制 tool_choice 也无视、finish_reason 为空)——baigong 已由 Anthropic 直通分支规避(uses_anthropic_native 默认 claude 全走直通,直通路径工具实测正常);报网关修兼容层 |
| qwen3.7-max 关思考 × 工具调用 | 7/7 全过 | 协议探针(真工具 schema):简单/嵌套复杂参数、流式 tool_call 增量拼装、克制不乱调(咨询题零误调)、工具结果回传收口全部通过——切换 worker 的协议层风险清零 |
| qwen3.7-max 关思考 × 框架层冒烟 | 全通 | 关思考注入已落码(BAIGONG_LLM_NO_THINKING_MODELS 默认 qwen,OpenAI 分支自动带 extra_body,commit 6862b195);build_chat_model 真实工具循环实测:工具调用 1.2s、结果收口 2.4s、流式首 token 0.4s 无雪球;haiku 对照(Anthropic 直通)4.0s/8.2s 同过——切换 = 一行 env(BAIGONG_LLM_MODEL) |
kimi-k3 | 别名错绑 | 响应 model 字段与自报身份均为 qwen3.7-max(『阿里巴巴,通义千问』)——同 a2 类问题,真 Kimi 待网关重绑后补测 |
deepseek-chat | 指向轻量档 | 实际路由 deepseek-v4-flash(DeepSeek 官方 2026-07-24 弃用 deepseek-chat 别名);自报身份漂移(DeepSeek-R1);旗舰要显式用 deepseek-v4-pro |
deepseek-v4-pro | 待补测 | max_tokens=60 探针返回空正文——疑思考型输出先耗尽预算,接入需更大 max_tokens 并确认 reasoning 字段处理 |
Anthropic 协议直通(/v1/messages + aigc/ 前缀) | 推荐备选 | opus-4-6 / haiku / opus-4-8 均为真 Claude,接受 temperature,流式为真增量;接入需客户端改用 Anthropic 协议(如 langchain-anthropic)。sonnet 仍为 a2 绑错(与协议无关) |
IM 对话的体验红线是首 token——用户盯着空气泡的时间。根因已坐实(直连百炼对拍):qwen 默认开深度思考(flash 裸测正文前吐出 5607 字思考流),关思考后 max 首 token 23s→1.4s。传法有讲究:顶层裸传 enable_thinking 经网关会被剥掉(无效),改用 vLLM 嵌套写法 "chat_template_kwargs": {"enable_thinking": false} 经网关实测 0.4–1.5s(true 对照 37.9s+3058 字思考流)——网关无需修改,客户端换写法即可。豆包 18–19s 疑同理(待用同款嵌套写法验证)。
| 模型 | 首 token | 总耗时 | 吐字速度 | IM 可用性判定 |
|---|---|---|---|---|
| claude-haiku-4-5(当前 worker) | 1.7s | 8.0s | 51 字/s | 优 |
| claude-opus-4-6(当前 complex) | 2.4s | 12.3s | 32 字/s | 良 |
| deepseek-v4-flash | 3.9s | 4.4s | 186 字/s | 良(回复偏短) |
| doubao-seed-2.0-pro / lite | 18–19s | 22s+ | 94 字/s | 不可用 |
| qwen3.7-max(两测)/ 3.7-plus | 22–33s | 27–38s | 104 字/s | 不可用 |
| qwen3.7-max · 直连百炼裸测(两测) | 23–25s | 28–30s | ~104 字/s | 同网关(默认思考) |
| qwen3.7-max · 直连 + enable_thinking:false | 1.41s | 6.1s | ~81 字/s | 优——qwen 救活 |
| qwen3.7-max · 经网关 + chat_template_kwargs 关思考(两测) | 0.4–1.5s | 6.3–6.7s | ~72 字/s | 优——网关即可,无需直连 |
| qwen3.7-flash · 直连 + 关思考 | 0.26s | 3.2s | ~176 字/s | 极快(轻量档候选) |
| kimi-k3 路由(两测) | 27–32s | 31–36s | ~104 字/s | 不可用(实为 qwen) |
测法:完整 persona 系统提示词(3657 字符)+『注册资本写多少合适?』,max_tokens 300,流式计时到首个内容帧/末帧。qwen 双测一致;qwen3.5-turbo 路由 400 不可用。kimi-k3 路由补测:流式帧 model 字段直接返回 qwen3.7-max(错绑第三重实锤)。直连对拍用阿里云百炼 MaaS workspace(cn-beijing),deepseek-v4-flash 直连 3.0s 与网关 3.9s 同量级(网关本身不加多少延迟);真 Kimi 在该 workspace 未开通(400 not activated),仍未测到。
量化综合分打平(4.4 vs 4.4)后,测试环境真机上出现体感分歧——用匿名盲评做最终裁决:两道真机同题(报税流程劝退『这个太麻烦了』/『还不如招个财务』),A/B 匿名截图群投。
结果:B(= claude-haiku-4-5)胜出——群体投票多数选 B;评审预注册盲评同向(A 3.5+3.5 / B 4.5+3,B 微胜)。
胜负手不在信息对错,在聊天质感:B 卸包袱(『你完全不用碰这些』直接拆掉焦虑的根)、带前文记忆(『和 A、B 那两位怎么谈』)、两字收尾(『挑一个?』);A(qwen 关思考)则是编号列表 + 加粗 + 报价菜单的文档腔,情绪宣泄时刻递决策菜单。这是六维快测量表没覆盖的维度——短对话评分抓不住长程聊天手感。
终判:生产 worker 定格 claude-haiku-4-5;qwen3.7-max 转入 complex 档(开思考,4.7 推理质量 + opus 零头价格)候选与 W6 终审。深层归因存档:persona v2 按 Claude 式提示词风格调制(素材包源自 Claude 系统提示词研究),对 Claude 家族是母语、对 qwen 是翻译腔——若未来重启 qwen worker,先做格式驯化(禁列表/限长/收尾多样化)再评。
按 roadmap 拍板在 W0 真实语料攒够后进行,结果直接追加到本页各数据区。
| 项 | 快测(本页 v1) | W6 终局(待补) |
|---|---|---|
| 题库 | F24 验收场景改编剧本(合成) | W0 采集的真实用户对话 |
| 评审 | 单评审(AI,利益相关) | 3–5 人盲评,不知模型归属 |
| 模型矩阵 | 4 个(受网关可用性限制) | + sonnet-5(persona 适配后,走直通或修复后路由)、豆包 seed-1.6;sonnet-4-6 视 a2 修复情况可选 |
| 维度 | 沿用本页六维评分 + 客观计数(口径不变,纵向可比) | |
| 决策规则 | 预先写死:sonnet 显著胜出→生产主力;haiku 差距小→混合路由;豆包中文单项领先→分场景混用试点;打平→维持现状 | |