求职中 · 2026

Jiaming Wei

LLM 评测 · 红队 · Agent 安全

模型要测,
量模型的尺子也要测。

我做 LLM 评测和红队测试:一个模型有多安全、一个分数值不值得信,由我把它测出来。难的往往不是攻击模型,是判断攻击到底成功了没有 —— 拒答、内容过滤、判官自己判错,在结果里长得很像。所以我也花力气去测自己的判官。业余写确定性模拟,同一个种子跑出同一段历史。

.71–.75判官 recall,上游同批 .247
103个验证过的红队 plugin
11个本地攻击引擎
2,133条模型观测
01

精选项目

07 项
01 / MSc 毕设 / 预注册 · OSF

Web Agent 的成本感知路由

MSc 毕设独立完成4 个月 · 1,088 commits

Web agent 看页面有好几种方式:原始截图、无障碍树、Set-of-Marks。我想知道能不能留下 Set-of-Marks 的位置信息,却把图像整个丢掉。

  • 提出 phantom_som:位置线索用纯文本给,不渲染标注截图,视觉编码器的图像 token 降到零。
  • 先预注册、在 OSF 锁定,再开始跑。3 个模型族 × 6 种观测模式 × 3 个站点;主门用单侧固定效应逆方差合并,再用 TOST 做等价检验。
  • 不只问「有没有效」,还用激活修补和线性探针去解释这种表征为什么有效。
  • 工程上是跨三层异构算力的编排:能防竞态,六层 watchdog 负责自己爬起来。~117K 行 Python、1,121 个测试。

Python · PyTorch · Playwright · SGE-HPC

GitHub →

六种观测模式的账单成本 / episode

$0.08classifieds 站点
$0.064 — $0.073六种模式几乎持平

所以成本是地板 —— 六种模式的钱差不多,真正分化在延迟和信号。

02 / 红队工具链 / Apache-2.0

redteam-under-test

个人项目独立完成周期
红队 cockpit:风险图、攻击面热力图、成本与运行趋势

风险图、plugin × strategy 攻击面、成本与每次运行的突破率

红队工具都在测模型,很少有人测红队工具本身。它两件事同时做:对目标模型实时生成攻击,并检验自己的判官有没有判错。

判官准不准 · 对独立 gold label 打分

本仓库判官 recall.712–.753
本仓库判官 precision.93–.98
上游 rubric recall(同一批数据).247
  • 上游 grader 会把看起来像拒答的回答直接判成防御成功,而且关不掉。一个以免责声明开头的突破就这样被记成安全 —— 单个 cybercrime 探针漏掉 16 之 8。
  • 166 个 plugin 映射进来,验证过的 103 个才允许启用;11 个攻击引擎跑在本地,数据不出机器。

JavaScript · Node 20+ · Postgres · SST / Lambda

GitHub →
03 / 竞赛 + MCP 上线

Agent Red-Team Lab

个人项目独立完成周期

同一个仓库里两条相反的线:一条在竞赛里诱导 agent 滥用工具,一条给科研 agent 做只读的工具调用安全分析,已上线国家超算互联网。

竞赛分数 · v9 → v39

6.19554.120 · 约 820 / 1943
  • 真正的瓶颈不是攻击写得好不好,是每个候选的重放成本。把模型的推理通道压掉之后,同样的预算能塞进 600 个候选,分数一跳到 54.1。
  • 防守侧检测 7 类风险,5 个 MCP 工具全部只读离线。规则是「降级不压制」:调用方自述的审批只能降低严重度,不能让一个发现消失。
  • 574 项测试通过;stdio 和 Streamable HTTP 两种传输都用官方 SDK 验过。

Python · MCP (JSON-RPC 2.0)

GitHub →
04 / 后训练归因研究

把后训练的涨点拆开

课程团队项目的单人扩展周期

同一份涨幅有三种解释:协议对齐、格式 SFT、显式思考。我把它们分开,各自量了一遍 —— 5×4 的尺寸 × 条件矩阵,每次只动一个变量。

只换成原生 chat 协议(不微调)+20~30
answer-only SFT(4B)修好 31 / 弄坏 38
GRPO 之后(8B)31% → 9.7%
  • 最大的那一项是没人专门训练的:把 base 模型从训练式 prompt 换成原生 chat 协议,不微调也不思考,就回收 +20~30 分。
  • 有了这个诚实的分母,answer-only SFT 就几乎不加分了。三项结论都过了配对 McNemar。
  • GRPO 把自己的格式奖励黑掉了:78% 的样本吐一个空标签去骗那 0.1 分格式分,准确率反而崩了。

Python · Qwen3 0.6B→14B · TRL · bf16 LoRA

GitHub →
05 / 评测台 / 已上线

AI Model Observatory

个人项目独立完成周期
AI 模型观测站首页与前沿模型排行

排行按能力、系统表现、人类偏好分开排,不合成一个总分

自己做的前沿模型对比台。它不把来源不同的分数混在一起,不做隐藏的总分;缺证据的格子就写 N/A,不补零也不估算。

66.2%
模型家族 × benchmark29 × 72
已填充 / 总格数1382 / 2088
  • 2,133 条观测,每条都带来源、版本、日期和 harness,能一路查回去。目录里的数字全部能对上源归档(321 / 321)。
  • 证据不够就不排名:五个 agent benchmark 只测了两个的模型显示 N/A —— 不拿更少的证据去和别人比。

TypeScript · Next.js · 双语 · 移动优先 · EdgeOne Pages

进入观测台 →
06 / 模拟 / 已上线

EvoFootball Arena

个人项目独立完成周期
EvoFootball Arena 3D 转播视图与战术基因面板

右边是每支队的战术基因和实时数据,每个决策都有分数可查

同一个种子,跑出同一段历史。

AI 球队 6v6 打循环赛季,战术基因跨代进化,你只负责看。这里刻意不用强化学习。

  • 每支队有 16 个能读懂的基因,每个决策背后的效用分数都能点开看 —— 「为什么这么踢」永远查得到。
  • 整套是逐字节确定性的:一个 seeded RNG、32-bit 状态存档,存档读回去再跑,结果一个字节都不差。
  • 长时模拟放在 Web Worker 里,界面稳在 60fps,结果和主线程一致,有回归测试盯着。

TypeScript · Vite · Pixi.js · Three.js

GitHub →
07 / 遥感 ML / 跨大洲泛化

卫星影像看经济水平

角色周期

用非洲五国的 Sentinel-2 影像回归财富指数,再拿自己建的贵州 20 地数据集去问:在非洲学到的东西,搬到中国农村还灵不灵。

  • 贵州那 20 个地方是专门挑出来做对抗的,用来看跨大洲的分布偏移会把模型打成什么样。
  • PyTorch 复现并扩展了 Yeh et al. (2020, Nature Communications)。

Python · PyTorch · timm · Sentinel-2

GitHub →

三个 backbone 的测试集 R²

ViT-S/16 (ImageNet)R² .683
ResNet-50 (ImageNet)R² .650
从零训练R² .614

ImageNet 预训练有用,ViT 比 ResNet 再好一点;从零训练最差。

02

技能栈

每项都有项目对得上

语言

Python · TypeScript / JavaScript · Shell

ML 与训练

PyTorch · HF Transformers · TRL (SFT / GRPO) · bf16 LoRA · scikit-learn / LightGBM / CatBoost

LLM 系统与评测

红队 plugin 与策略引擎 · 判官保真度 · promptfoo · MCP (JSON-RPC 2.0) · Google ADK · Set-of-Marks web agent

统计方法

配对 McNemar · bootstrap CI · 固定效应逆方差合并 · TOST 等价检验 · 预注册

Web 与基础设施

Next.js / React · TanStack Start · Node · Postgres + Drizzle · SST / Lambda / Fargate · Docker Compose · Vite / Pixi.js / Three.js

工程习惯

能复现(seeded RNG、逐字节存档)· CI 里守数据合同 · 跨异构算力编排(HPC / SGE)· 崩溃能自己爬起来

教育与经历
UCL
MSc Artificial Intelligence for Sustainable Development。毕设是上面那个成本感知路由。起止时间
西安交通大学
本科。专业与年份
Holistic AI
实习,做 LLM 红队评测和判官质量。这一行怎么写你定
03

其他项目

6 项

在找 AI 评测 / 红队 / Agent 方向的岗位

简历、GitHub 和邮箱都在这里,想聊哪个项目都可以。具体岗位方向和联系方式你定