大模型降智测试 · 模型对比 · 鹈鹕骑车 SVG + 糖果题
大模型降智测试与模型对比:GPT-6 vs Claude vs DeepSeek vs Kimi
用你自己的 API Key,对最多四个模型同时运行 manxue.ai 带火的两道测试题——鹈鹕骑自行车的 SVG 循环动画,以及一道抽屉原理糖果题——并排对比它们的回答。
由维护者用与下方竞技场完全相同的提示词和判定规则实际跑出的回答;每个 SVG 都会先在你的浏览器里重新校验再绘制。往下滚动,填入自己的 Key,勾选同样的模型再跑一次,就能和新的场景 / 校验码对照。
设置
接口、密钥、模型与测试项
API Key 只保存在本页内存中,只会发送到上面填写的接口地址,不会写入浏览器存储。
本次场景 · 校验码:
每次运行都会用你自己的余额,对每个模型的每个测试项各发送一次真实的付费请求,不会自动重试。部分模型会以 HTTP 400 拒绝过高的输出上限——调低即可,那是上游限制而不是模型失败。Claude 5 系列会把隐藏推理也计入上限,所以这里默认 32000 而不是 manxue 的 16000。
请求预览(cURL,已隐去密钥)
结果
每个模型一张卡片;徽标显示 SVG 安全性、动画、校验码以及糖果题判定
选择模型后运行
SVG 预览以图片方式渲染(不执行脚本、不加载外部资源);完整回答和源码可折叠查看。
这些测试衡量什么
糖果题的判定只检查回答中是否出现独立的数字 21,不做语义评分。鹈鹕题在 SVG 可解析、不含脚本或外部引用、声明了动画、并在 <text> 元素中显示校验码时判为通过。两道题都不能证明模型身份或整体能力。提示词逐字复制自 manxue-ai,因此结果可与 manxue.ai 直接对比。