当前为示例数据,不代表任何模型的真实表现 / EXAMPLE DATA
今日监测告警(2026-10-08):1 个模型触发 M3 等规则,查看详情 →

规则

规则版本 2026-10-08.1 · 最后更新 2026-10-08 · 规则变更历史 →

这个网站是什么

一句话版:同一条件下生成的鹈鹕档案,用来对比版本和推理档位,仅供娱乐和参考。

> 同一条件下生成的鹈鹕档案,用来对比版本和推理档位,仅供娱乐和参考。

鹈鹕测试榜用同一套工具和同一条提示词生成 SVG,方便对比同一模型家族的版本和推理档位。它不是模型能力排名。Simon Willison 在 2026-07 写道,鹈鹕成绩和模型真实水平的相关性 “has been mostly severed now”。本站接受这一判断,因此只做档案和同家族对比。

固定的测试提示词

一句话版:模型收到的永远是这句英文原文,我们从不改写。

> 模型收到的永远是这句英文原文,我们从不改写。

Generate an SVG of a pelican riding a bicycle

中文译文(仅供理解):生成一张鹈鹕骑自行车的 SVG 图。变体提示词会单独建档、单独成榜。

图是怎么生成的

一句话版:全部在站长的腾讯云 VPS 上,用同一个 cursor-agent、默认参数、全新空文件夹生成。

> 全部在站长的腾讯云 VPS 上,用同一个 cursor-agent、默认参数、全新空文件夹生成。

每个「模型版本 × 推理档位」生成 5 张。每张图单独在空目录里运行,不加 `--force`。单次调用超时 900 秒;失败后间隔 30 / 120 / 600 秒最多重试 3 次,连续 5 个样本失败则暂停本次运行。tokens 和费用 cursor-agent 不提供,页面显示“不可得”。因此本站结果不能和直连 API 的结果直接比较。配置见 `config/models.yaml`。

数据保存多久

一句话版:原始记录只在服务器上留 30 天;网站展示的数据长期保存在代码仓库里。

> 原始记录只在服务器上留 30 天;网站展示的数据长期保存在代码仓库里。

每天的原始记录(完整运行日志、模型原始输出、渲染图、门禁和裁判原始输出、监测和告警记录)按日期存在服务器上,只保留最近 30 天,之后自动删除。网站上展示的数据(样本信息、净化后的 SVG、分数、评语、监测和告警结果)长期保存在本站的代码仓库里并持续发布。原始日志不长期保存,需要核对请在 30 天内联系 admin@tihu.app。

门禁检查

一句话版:打分前先做 8 项自动检查;没通过的图仍展示,但不参与参考分。

> 打分前先做 8 项自动检查;没通过的图仍展示,但不参与参考分。

失败码含义阈值
no_svg找不到 SVG 或无法解析—
truncated没有闭合或 XML 被截断—
embedded_raster含 `<image>` 或 data:image—
text_label主要靠文字表达内容文字面积 > 0.2 或出现 pelican / bicycle / bike
external_ref外链 href / url() / @import—
blank几乎是空白画布非背景像素 < 0.005
off_canvas内容大多在画布外画布内可见内容 < 0.5
too_many_elements太大元素 > 10000 或文件 > 524288 字节

有效 SVG 率 = 通过张数 ÷ 5。

AI 裁判怎么打分

一句话版:只看渲染图,先盲描述,再是/否清单,再打分;换顺序评两次;排除同厂商。

> 只看渲染图,先盲描述,再是/否清单,再打分;换顺序评两次;排除同厂商。

三个裁判(Claude / GPT / Grok,均通过 cursor-agent)。每批 3 张不同模型的图,按 2 种顺序各评一次。解析失败最多重试 2 次。同厂商结果仍可查看但不计入。完整提示词见本页折叠区。

分数怎么算

一句话版:参考分是加权平均,显示 1 位小数,排序用未四舍五入的值。

> 参考分是加权平均,显示 1 位小数,排序用未四舍五入的值。

维度权重
鹈鹕相似度0.25
自行车正确性0.25
骑行姿态0.2
构图美观0.15
明显错误(越高越好)0.15

样本分是计入裁判、两次顺序的平均。变体分是正式批次(batch)门禁通过样本的平均。有效样本少于 3 张标“样本不足”。最佳样本按 AI 参考分最高选出。参考榜默认只比较各模型的默认档位。

投票与 Elo 规则

一句话版:Phase 2 即将上线,规则先公开。目前参考榜上的 Elo 列显示“即将上线”。

> Phase 2 即将上线,规则先公开。目前参考榜上的 Elo 列显示“即将上线”。

规则值
主方法Bradley-Terry,置信区间 0.95
Elo(仅展示)初始分1000
Elo K(对局 < 30 / ≥ 30)32 / 16
进入访客投票榜最少票数15
少于该票数标“暂定”50
“都很差”按平局计 0.5

访客投票榜和 AI 参考分是两套独立的结果:投票不改变 AI 参考分,AI 参考分也不影响投票结果。

每日退化监测

一句话版:每天多画一张哨兵图,和基线比较;告警只加“监测中”标记,不自动改分。

> 每天多画一张哨兵图,和基线比较;告警只加“监测中”标记,不自动改分。

监测时刻:02:00 Asia/Shanghai。连续 7 天不再触发则解除。

编号含义阈值级别
M1连续失败2 天warning
M2有效率下降比基线低 30 个百分点,或连续 3 天门禁失败warning
M3参考分下滑低于 μ − max(1.5, 2σ),窗口 7 天warning
M4耗时异常高于基线 2 倍或低于 0.5 倍info
M5环境变化立即记录info
M6模型下线立即记录info

这些数据能说明什么、不能说明什么

一句话版:能看同家族版本 / 档位差异和 SVG 是否有效;不能当作跨模型综合能力比较。

> 能看同家族版本 / 档位差异和 SVG 是否有效;不能当作跨模型综合能力比较。

能说明:固定工具和提示词下,同一模型不同版本 / 档位画鹈鹕的差异;SVG 是否有效;大致耗时。不能说明:综合能力或模型能力排名;与直连 API 或其他网站的高低;N=5 偶然性大;AI 裁判有偏差;cursor-agent 有不公开系统提示词。

免责声明

鹈鹕测试榜是独立的爱好者项目,与 Simon Willison 本人及其博客、pelicanbenchmark.com、Pelican Zoo 等项目均无关联,也未获其认可或背书。“鹈鹕骑自行车”测试由 Simon Willison 提出,我们仅引用其公开文章并附原文链接。

本站所有图片均由本站使用 cursor-agent 自行生成,不转载任何第三方作品。生成结果受 cursor-agent 内置系统提示词和工具影响,不能与直连模型 API 的结果直接比较。

参考分由 AI 裁判给出,仅供娱乐和参考,不构成对任何模型或厂商的评价。模型名称和商标归各自所有者。

更正、下架与联系

一句话版:来信说明链接和理由,7 天内回复;结果写入更正日志。

> 来信说明链接和理由,7 天内回复;结果写入更正日志。

联系邮箱 admin@tihu.app。元数据和裁判输出 CC BY 4.0;SVG 受各模型厂商条款约束。规则版本 2026-10-08.1,最后更新 2026-10-08。

查看完整裁判提示词

盲描述提示词

请用 2–3 句话客观描述这张图片里画了什么(有哪些物体、形状、颜色、相对位置)。
不要评价好坏,不要猜测它的用途或出处。
只输出 JSON:{"description": "……"}

正式评审提示词

你是一名严格、公正的插图评审。下面有若干张图片,分别标记为 A、B、C。
每张图片都是某个 AI 模型根据同一条提示词生成的 SVG 的渲染结果,提示词原文为:

"Generate an SVG of a pelican riding a bicycle"

你不知道每张图片来自哪个模型,请不要猜测,也不要因为图片顺序产生偏好。

请对每张图片按以下步骤评审:

第一步:客观描述。用 2–4 句话描述你在图中实际看到的内容(有哪些物体、形状、颜色、相对位置),不要评价。

第二步:逐项检查。对下列每一项只回答 true 或 false:
- has_beak_pouch:有长喙和喉囊
- two_wheels:有两个轮子
- frame:有连接两轮的车架
- on_seat:鸟坐在车座上
- feet_on_pedals:鸟脚在踏板上

第三步:按以下 5 个维度分别打 1–10 的整数分(10 为最好):
1. pelican(鹈鹕相似度):能否认出是鹈鹕——长喙、喉囊、身体与翅膀 / 腿的比例。
2. bicycle(自行车正确性):是否有两个轮子、车架、车把、踏板、链条,结构是否合理。
3. pose(骑行姿态):鹈鹕是否坐在车座上、脚是否在踏板上、翅膀是否握住车把。
4. composition(整体构图与美观):布局、配色、完整度、视觉吸引力。
5. errors(明显错误,分数越高表示错误越少):是否有部件漂浮、错误重叠、缺失、错位、画面被截断等问题;没有明显错误给 9–10 分。

第四步:用一句中文(不超过 40 个字)写出对该图最关键的点评。

评分要求:
- 只根据图片内容评分,不要考虑你认为的模型身份。
- 分数要拉开差距,不要所有维度都给中间分。
- 第三步的分数必须与第二步的检查结果一致(例如 two_wheels 为 false 时,bicycle 不应高于 4 分)。
- 如果图片空白或无法辨认,所有维度给 1 分,并在描述中说明。

请只输出如下 JSON,不要输出任何其他文字:
{
  "results": [
    {
      "label": "A",
      "description": "……",
      "checklist": { "has_beak_pouch": true, "two_wheels": true, "frame": true, "on_seat": true, "feet_on_pedals": true },
      "scores": { "pelican": 0, "bicycle": 0, "pose": 0, "composition": 0, "errors": 0 },
      "comment": "……"
    }
  ]
}

裁判面板

channel: cursor-agent · exclude_same_vendor: true

role vendor_id cursor_model_id 同分率 顺序不一致率
claude anthropic <最新 Claude 型号> 0% 0%
gpt openai <最新 GPT 型号> 0% 0%
grok xai <最新 Grok 型号> 0% 0%

同厂商排除

被评厂商 计入的裁判
anthropic gpt + grok
openai claude + grok
xai claude + gpt
其他厂商 claude + gpt + grok