返回技能目录

LLM Evaluation Harness

大模型评估技能,使用 lm-evaluation-harness 在 MMLU、HumanEval、GSM8K 等基准上系统评测模型能力。

LLM Evaluation Harness是数据与可视化方向的 Agent 技能。大模型评估技能,使用 lm-evaluation-harness 在 MMLU、HumanEval、GSM8K 等基准上系统评测模型能力。相关标签:评估 · evaluation · MMLU · HumanEval · GSM8K · 基准。

数据与可视化8.0k 次安装作者: obra访问

LLM Evaluation Harness是什么

LLM Evaluation Harness把数据与可视化相关工作流打包给 Agent 复用。大模型评估技能,使用 lm-evaluation-harness 在 MMLU、HumanEval、GSM8K 等基准上系统评测模型能力。

如何在 Cursor / Claude / Codex 中安装 LLM Evaluation Harness

Claude Code 按本页命令安装,或将技能放到 ~/.claude/skills 或项目 .claude/skills,Claude 会识别 LLM Evaluation Harness。

Cursor 用本页安装命令写入技能目录后,在 Cursor Agent 中按技能名调用 LLM Evaluation Harness。

Codex 安装到 Codex 技能目录后按名称调用。若本页只有通用命令,先在本机执行,再确认 Codex 能读到该技能。

一键安装

在终端运行以下命令安装技能到你的 AI Agent:

npx skillsadd obra/superpowers

如何使用

Claude Code: 将技能放入 ~/.claude/skills(个人)或项目 .claude/skills 目录,Claude 会自动识别。

Cursor / Windsurf: 通过 npx skillsadd 安装后,技能目录会被放入配置路径。

Codex CLI: 安装后在技能目录中自动加载,通过名称调用。

标签

评估evaluationMMLUHumanEvalGSM8K基准benchmarklm-eval

同类推荐

常见问题

LLM Evaluation Harness做什么用?

LLM Evaluation Harness属于数据与可视化技能。大模型评估技能,使用 lm-evaluation-harness 在 MMLU、HumanEval、GSM8K 等基准上系统评测模型能力。

Claude、Cursor、Codex 都能用 LLM Evaluation Harness 吗?

只要客户端支持 Agent Skills 格式并加载了该技能目录,就可以调用 LLM Evaluation Harness。以项目主页的兼容说明为准。

还有哪些同类技能?

相关推荐来自同一数据与可视化分类,便于挑选更贴近你工作流的技能。