大模型降智测试 · 模型对比 · 鹈鹕骑车 SVG + 糖果题

大模型降智测试与模型对比:GPT-6 vs Claude vs DeepSeek vs Kimi

用你自己的 API Key,对最多四个模型同时运行 manxue.ai 带火的两道测试题——鹈鹕骑自行车的 SVG 循环动画,以及一道抽屉原理糖果题——并排对比它们的回答。

设置

接口、密钥、模型与测试项

REQUEST

API Key 只保存在本页内存中,只会发送到上面填写的接口地址,不会写入浏览器存储。

本次场景 · 校验码:

每次运行都会用你自己的余额,对每个模型的每个测试项各发送一次真实的付费请求,不会自动重试。部分模型会以 HTTP 400 拒绝过高的输出上限——调低即可,那是上游限制而不是模型失败。Claude 5 系列会把隐藏推理也计入上限,所以这里默认 32000 而不是 manxue 的 16000。

请求预览(cURL,已隐去密钥)

结果

每个模型一张卡片;徽标显示 SVG 安全性、动画、校验码以及糖果题判定

RESULTS

选择模型后运行

SVG 预览以图片方式渲染(不执行脚本、不加载外部资源);完整回答和源码可折叠查看。

这些测试衡量什么

糖果题的判定只检查回答中是否出现独立的数字 21,不做语义评分。鹈鹕题在 SVG 可解析、不含脚本或外部引用、声明了动画、并在 <text> 元素中显示校验码时判为通过。两道题都不能证明模型身份或整体能力。提示词逐字复制自 manxue-ai,因此结果可与 manxue.ai 直接对比。