Superdata RobotAI
首页
数据集
数据标准
排行榜
工具/平台
技术博客
中
/
EN
GitHub
🏆 Benchmark 排行榜
按标准 benchmark 上的模型性能对比训练数据集。分数越高 = 训练数据越有效。
共 10 个评测基准,9 个训练数据集参与对比
🏆
CALVIN
ETH Zurich
**CALVIN Benchmark** 是 ETH Zurich 提出的语言条件长序列机器人操作基准。 定义了一套标准化的**任务定义格式、评估协议和数据划分**(ABCD 四分割),测试策略在未见环境、未见指令、未见物体上的泛化能力。...
🏆
LIBERO
斯坦福大学 (Stanford University) / 艾伦人工智能研究所 (AI2)
**LIBERO** 是 Stanford / AI2 提出的终生机器人学习基准。 定义了 **130 个语言条件操作任务**,覆盖 **5 大维度泛化测试**(场景、物体、布局、任务组合、未见任务)。 数据以 HDF5 格式发布,提供...
🏆
Meta-World
斯坦福大学 (Stanford University) / 加州大学伯克利分校 (UC Berkeley)
**Meta-World** 是斯坦福大学和 UC Berkeley 于 2019 年 CoRL 发布的经典 MuJoCo 桌面机械臂评测基准,核心面向多任务强化学习 (Multi-Task RL) 和元强化学习 (Meta-RL)。 *...
🏆
BEHAVIOR-1K
斯坦福大学 (Stanford University) / 杜克大学 (Duke University)
**BEHAVIOR-1K** 是 Stanford / Duke 等提出的超大规模日常生活任务基准。 在 OmniGibson 仿真中定义了 **1,000 个家居活动任务**(清洁、烹饪、整理等)。 以 **BDDL(BEHAVIO...
🏆
EmbodiedBench
UIUC / Northwestern / Purdue
EmbodiedBench 是面向多模态大模型 (MLLM) 的综合具身评测基准。融合 4 大仿真环境(EB-ALFRED/EB-Habitat/EB-Navigation/EB-Manipulation),评估 6 大核心能力。注意:评测...
🏆
LIBERO-Plus
复旦大学 (Fudan University) / 同济大学 (Tongji University)
**LIBERO-Plus** 是复旦大学和同济大学于 2025 年 10 月发布的 VLA 模型鲁棒性深度评测基准(arxiv 2510.13626),是对 LIBERO 基准的**系统化鲁棒性扩展**。 LIBERO 标准评测中 VL...
🏆
VLABench
VLABench Team
**VLABench** 是一个面向视觉-语言-动作 (VLA) 模型的综合评测基准,涵盖多种机器人操作原语和复杂任务场景。 **6 个评测 Track**: 1. Track 1 — In Distribution(分布内泛化) 2. ...
🏆
RoboTwin 2.0
RoboTwin Team / 清华大学 (Tsinghua University)
**RoboTwin 2.0** 是清华大学等机构发布的双臂机器人操作评测基准,基于数字孪生技术构建高保真仿真环境。 评测包含多个双臂协作任务,分 **Easy** 和 **Hard** 两级难度,评估模型在复杂双臂操作中的精确控制能力。...
🏆
RoboChallenge
RoboChallenge Consortium
**RoboChallenge Table30** 是全球首个大规模远程真机评测平台,核心解决「仿真高分、真机拉胯」的 Sim2Real 鸿沟。 **硬件体系**:支持 4 类主流真机集群(共 10 台远程机器人)——UR5 6DoF 单...
🏆
GM-100
上海交通大学 (Shanghai Jiao Tong University) / 蚂蚁灵波 (Robbyant) / SII / RHOS.ai
**GM-100(The Great March 100)**是上海交通大学人工智能学院李永露副教授团队联合蚂蚁灵波(Robbyant)、SII、RHOS.ai 发布的**真实机器人操作评测基准**,被业界称为具身智能的「统考卷」或「上海卷...
💬 AI 助手
🔍 搜索
AI 助手
✕
DeepSeek V4 Flash
DeepSeek V3
DeepSeek R1
搜索
输入需求,AI 帮你在 58 个数据集、19 个标准、18 个工具中智能匹配