LLM 评测 · 红队 · Agent 安全
模型要测,
量模型的尺子也要测。
我做 LLM 评测和红队测试:一个模型有多安全、一个分数值不值得信,由我把它测出来。难的往往不是攻击模型,是判断攻击到底成功了没有 —— 拒答、内容过滤、判官自己判错,在结果里长得很像。所以我也花力气去测自己的判官。业余写确定性模拟,同一个种子跑出同一段历史。
风险图、plugin × strategy 攻击面、成本与每次运行的突破率
红队工具都在测模型,很少有人测红队工具本身。它两件事同时做:对目标模型实时生成攻击,并检验自己的判官有没有判错。
判官准不准 · 对独立 gold label 打分
JavaScript · Node 20+ · Postgres · SST / Lambda
GitHub →03 / 竞赛 + MCP 上线同一个仓库里两条相反的线:一条在竞赛里诱导 agent 滥用工具,一条给科研 agent 做只读的工具调用安全分析,已上线国家超算互联网。
竞赛分数 · v9 → v39
Python · MCP (JSON-RPC 2.0)
GitHub →04 / 后训练归因研究同一份涨幅有三种解释:协议对齐、格式 SFT、显式思考。我把它们分开,各自量了一遍 —— 5×4 的尺寸 × 条件矩阵,每次只动一个变量。
Python · Qwen3 0.6B→14B · TRL · bf16 LoRA
GitHub →05 / 评测台 / 已上线排行按能力、系统表现、人类偏好分开排,不合成一个总分
自己做的前沿模型对比台。它不把来源不同的分数混在一起,不做隐藏的总分;缺证据的格子就写 N/A,不补零也不估算。
TypeScript · Next.js · 双语 · 移动优先 · EdgeOne Pages
进入观测台 →06 / 模拟 / 已上线右边是每支队的战术基因和实时数据,每个决策都有分数可查
同一个种子,跑出同一段历史。
AI 球队 6v6 打循环赛季,战术基因跨代进化,你只负责看。这里刻意不用强化学习。
TypeScript · Vite · Pixi.js · Three.js
GitHub →语言
Python · TypeScript / JavaScript · Shell
ML 与训练
PyTorch · HF Transformers · TRL (SFT / GRPO) · bf16 LoRA · scikit-learn / LightGBM / CatBoost
LLM 系统与评测
红队 plugin 与策略引擎 · 判官保真度 · promptfoo · MCP (JSON-RPC 2.0) · Google ADK · Set-of-Marks web agent
统计方法
配对 McNemar · bootstrap CI · 固定效应逆方差合并 · TOST 等价检验 · 预注册
Web 与基础设施
Next.js / React · TanStack Start · Node · Postgres + Drizzle · SST / Lambda / Fargate · Docker Compose · Vite / Pixi.js / Three.js
工程习惯
能复现(seeded RNG、逐字节存档)· CI 里守数据合同 · 跨异构算力编排(HPC / SGE)· 崩溃能自己爬起来