规则
规则版本 2026-10-08.1 · 最后更新 2026-10-08 · 规则变更历史 →
这个网站是什么
一句话版:同一条件下生成的鹈鹕档案,用来对比版本和推理档位,仅供娱乐和参考。
> 同一条件下生成的鹈鹕档案,用来对比版本和推理档位,仅供娱乐和参考。
鹈鹕测试榜用同一套工具和同一条提示词生成 SVG,方便对比同一模型家族的版本和推理档位。它不是模型能力排名。Simon Willison 在 2026-07 写道,鹈鹕成绩和模型真实水平的相关性 “has been mostly severed now”。本站接受这一判断,因此只做档案和同家族对比。
固定的测试提示词
一句话版:模型收到的永远是这句英文原文,我们从不改写。
> 模型收到的永远是这句英文原文,我们从不改写。
Generate an SVG of a pelican riding a bicycle
中文译文(仅供理解):生成一张鹈鹕骑自行车的 SVG 图。变体提示词会单独建档、单独成榜。
图是怎么生成的
一句话版:全部在站长的腾讯云 VPS 上,用同一个 cursor-agent、默认参数、全新空文件夹生成。
> 全部在站长的腾讯云 VPS 上,用同一个 cursor-agent、默认参数、全新空文件夹生成。
每个「模型版本 × 推理档位」生成 5 张。每张图单独在空目录里运行,不加 `--force`。单次调用超时 900 秒;失败后间隔 30 / 120 / 600 秒最多重试 3 次,连续 5 个样本失败则暂停本次运行。tokens 和费用 cursor-agent 不提供,页面显示“不可得”。因此本站结果不能和直连 API 的结果直接比较。配置见 `config/models.yaml`。
数据保存多久
一句话版:原始记录只在服务器上留 30 天;网站展示的数据长期保存在代码仓库里。
> 原始记录只在服务器上留 30 天;网站展示的数据长期保存在代码仓库里。
每天的原始记录(完整运行日志、模型原始输出、渲染图、门禁和裁判原始输出、监测和告警记录)按日期存在服务器上,只保留最近 30 天,之后自动删除。网站上展示的数据(样本信息、净化后的 SVG、分数、评语、监测和告警结果)长期保存在本站的代码仓库里并持续发布。原始日志不长期保存,需要核对请在 30 天内联系 admin@tihu.app。
门禁检查
一句话版:打分前先做 8 项自动检查;没通过的图仍展示,但不参与参考分。
> 打分前先做 8 项自动检查;没通过的图仍展示,但不参与参考分。
| 失败码 | 含义 | 阈值 |
|---|---|---|
| no_svg | 找不到 SVG 或无法解析 | — |
| truncated | 没有闭合或 XML 被截断 | — |
| embedded_raster | 含 `<image>` 或 data:image | — |
| text_label | 主要靠文字表达内容 | 文字面积 > 0.2 或出现 pelican / bicycle / bike |
| external_ref | 外链 href / url() / @import | — |
| blank | 几乎是空白画布 | 非背景像素 < 0.005 |
| off_canvas | 内容大多在画布外 | 画布内可见内容 < 0.5 |
| too_many_elements | 太大 | 元素 > 10000 或文件 > 524288 字节 |
有效 SVG 率 = 通过张数 ÷ 5。
AI 裁判怎么打分
一句话版:只看渲染图,先盲描述,再是/否清单,再打分;换顺序评两次;排除同厂商。
> 只看渲染图,先盲描述,再是/否清单,再打分;换顺序评两次;排除同厂商。
三个裁判(Claude / GPT / Grok,均通过 cursor-agent)。每批 3 张不同模型的图,按 2 种顺序各评一次。解析失败最多重试 2 次。同厂商结果仍可查看但不计入。完整提示词见本页折叠区。
分数怎么算
一句话版:参考分是加权平均,显示 1 位小数,排序用未四舍五入的值。
> 参考分是加权平均,显示 1 位小数,排序用未四舍五入的值。
| 维度 | 权重 |
|---|---|
| 鹈鹕相似度 | 0.25 |
| 自行车正确性 | 0.25 |
| 骑行姿态 | 0.2 |
| 构图美观 | 0.15 |
| 明显错误(越高越好) | 0.15 |
样本分是计入裁判、两次顺序的平均。变体分是正式批次(batch)门禁通过样本的平均。有效样本少于 3 张标“样本不足”。最佳样本按 AI 参考分最高选出。参考榜默认只比较各模型的默认档位。
投票与 Elo 规则
一句话版:Phase 2 即将上线,规则先公开。目前参考榜上的 Elo 列显示“即将上线”。
> Phase 2 即将上线,规则先公开。目前参考榜上的 Elo 列显示“即将上线”。
| 规则 | 值 |
|---|---|
| 主方法 | Bradley-Terry,置信区间 0.95 |
| Elo(仅展示)初始分 | 1000 |
| Elo K(对局 < 30 / ≥ 30) | 32 / 16 |
| 进入访客投票榜最少票数 | 15 |
| 少于该票数标“暂定” | 50 |
| “都很差” | 按平局计 0.5 |
访客投票榜和 AI 参考分是两套独立的结果:投票不改变 AI 参考分,AI 参考分也不影响投票结果。
每日退化监测
一句话版:每天多画一张哨兵图,和基线比较;告警只加“监测中”标记,不自动改分。
> 每天多画一张哨兵图,和基线比较;告警只加“监测中”标记,不自动改分。
监测时刻:02:00 Asia/Shanghai。连续 7 天不再触发则解除。
| 编号 | 含义 | 阈值 | 级别 |
|---|---|---|---|
| M1 | 连续失败 | 2 天 | warning |
| M2 | 有效率下降 | 比基线低 30 个百分点,或连续 3 天门禁失败 | warning |
| M3 | 参考分下滑 | 低于 μ − max(1.5, 2σ),窗口 7 天 | warning |
| M4 | 耗时异常 | 高于基线 2 倍或低于 0.5 倍 | info |
| M5 | 环境变化 | 立即记录 | info |
| M6 | 模型下线 | 立即记录 | info |
这些数据能说明什么、不能说明什么
一句话版:能看同家族版本 / 档位差异和 SVG 是否有效;不能当作跨模型综合能力比较。
> 能看同家族版本 / 档位差异和 SVG 是否有效;不能当作跨模型综合能力比较。
能说明:固定工具和提示词下,同一模型不同版本 / 档位画鹈鹕的差异;SVG 是否有效;大致耗时。不能说明:综合能力或模型能力排名;与直连 API 或其他网站的高低;N=5 偶然性大;AI 裁判有偏差;cursor-agent 有不公开系统提示词。
免责声明
鹈鹕测试榜是独立的爱好者项目,与 Simon Willison 本人及其博客、pelicanbenchmark.com、Pelican Zoo 等项目均无关联,也未获其认可或背书。“鹈鹕骑自行车”测试由 Simon Willison 提出,我们仅引用其公开文章并附原文链接。
本站所有图片均由本站使用 cursor-agent 自行生成,不转载任何第三方作品。生成结果受 cursor-agent 内置系统提示词和工具影响,不能与直连模型 API 的结果直接比较。
参考分由 AI 裁判给出,仅供娱乐和参考,不构成对任何模型或厂商的评价。模型名称和商标归各自所有者。
更正、下架与联系
一句话版:来信说明链接和理由,7 天内回复;结果写入更正日志。
> 来信说明链接和理由,7 天内回复;结果写入更正日志。
联系邮箱 admin@tihu.app。元数据和裁判输出 CC BY 4.0;SVG 受各模型厂商条款约束。规则版本 2026-10-08.1,最后更新 2026-10-08。
查看完整裁判提示词
盲描述提示词
请用 2–3 句话客观描述这张图片里画了什么(有哪些物体、形状、颜色、相对位置)。
不要评价好坏,不要猜测它的用途或出处。
只输出 JSON:{"description": "……"} 正式评审提示词
你是一名严格、公正的插图评审。下面有若干张图片,分别标记为 A、B、C。
每张图片都是某个 AI 模型根据同一条提示词生成的 SVG 的渲染结果,提示词原文为:
"Generate an SVG of a pelican riding a bicycle"
你不知道每张图片来自哪个模型,请不要猜测,也不要因为图片顺序产生偏好。
请对每张图片按以下步骤评审:
第一步:客观描述。用 2–4 句话描述你在图中实际看到的内容(有哪些物体、形状、颜色、相对位置),不要评价。
第二步:逐项检查。对下列每一项只回答 true 或 false:
- has_beak_pouch:有长喙和喉囊
- two_wheels:有两个轮子
- frame:有连接两轮的车架
- on_seat:鸟坐在车座上
- feet_on_pedals:鸟脚在踏板上
第三步:按以下 5 个维度分别打 1–10 的整数分(10 为最好):
1. pelican(鹈鹕相似度):能否认出是鹈鹕——长喙、喉囊、身体与翅膀 / 腿的比例。
2. bicycle(自行车正确性):是否有两个轮子、车架、车把、踏板、链条,结构是否合理。
3. pose(骑行姿态):鹈鹕是否坐在车座上、脚是否在踏板上、翅膀是否握住车把。
4. composition(整体构图与美观):布局、配色、完整度、视觉吸引力。
5. errors(明显错误,分数越高表示错误越少):是否有部件漂浮、错误重叠、缺失、错位、画面被截断等问题;没有明显错误给 9–10 分。
第四步:用一句中文(不超过 40 个字)写出对该图最关键的点评。
评分要求:
- 只根据图片内容评分,不要考虑你认为的模型身份。
- 分数要拉开差距,不要所有维度都给中间分。
- 第三步的分数必须与第二步的检查结果一致(例如 two_wheels 为 false 时,bicycle 不应高于 4 分)。
- 如果图片空白或无法辨认,所有维度给 1 分,并在描述中说明。
请只输出如下 JSON,不要输出任何其他文字:
{
"results": [
{
"label": "A",
"description": "……",
"checklist": { "has_beak_pouch": true, "two_wheels": true, "frame": true, "on_seat": true, "feet_on_pedals": true },
"scores": { "pelican": 0, "bicycle": 0, "pose": 0, "composition": 0, "errors": 0 },
"comment": "……"
}
]
} 裁判面板
channel: cursor-agent · exclude_same_vendor: true
| role | vendor_id | cursor_model_id | 同分率 | 顺序不一致率 |
|---|---|---|---|---|
| claude | anthropic | <最新 Claude 型号> | 0% | 0% |
| gpt | openai | <最新 GPT 型号> | 0% | 0% |
| grok | xai | <最新 Grok 型号> | 0% | 0% |
同厂商排除
| 被评厂商 | 计入的裁判 |
|---|---|
| anthropic | gpt + grok |
| openai | claude + grok |
| xai | claude + gpt |
| 其他厂商 | claude + gpt + grok |