对照餐饮服务时,公开文献提供的是问题定义,不是拓比科技的实验结果。下面只转述可检索工作的公开范围,便于场景认知,不表示这些数据由拓比采集或已复现其结论。

第一人称视频与机器人动作不是一回事
Ego4D(Grauman 等,CVPR 2022)和厨房向的 EPIC-KITCHENS 说明:大规模第一人称视频能覆盖日常场景,但多数片段没有可执行的机器人动作。对餐饮服务,头戴视频适合看“人怎么做”,不能直接当成策略的动作标签。
真机数据强调场景数,而不只是条数
DROID(Khazatsky 等,arXiv:2403.12945)把采集放在大量真实建筑与场景中;Open X-Embodiment / RT-X(ICRA 2024)则把多家机构、多种本体的数据放到统一格式里讨论迁移。对餐饮服务的启示是:换一条产线或一个货架,往往就是新场景,不能用单一实验室桌子代表整个行业。
2025 年前后,手部与无本体接口被写进论文
EgoDex(arXiv:2505.11709,2025)讨论从大规模第一人称视频学习灵巧操作;OpenEgo(arXiv:2509.05513,2025)尝试把多源第一人称数据整理成带手部轨迹与动作基元的格式。UMI(Chi 等,RSS 2024)则说明无本体手持接口可以采集操作,但腕部视角与机器人相机之间存在域差。OpenVLA(arXiv:2406.09246)代表把视觉语言动作做成开放权重的一条路线。这些工作共同把餐饮服务的数据问题从“有没有视频”推进到“手、物体、时间是否对齐”。
对拓比场景工作的含义
我们把快餐简餐中的备餐、装盒、出餐传递写成可筛选作业,是为了让采集清单靠近论文里的技能与场景划分。这不表示现货已覆盖上述论文的全部任务,也不表示用拓比数据即可达到论文中的成功率。
合规说明:本文为场景方法与公开文献对照,不构成对采集成功率、模型效果或交期的承诺。设备组合、可交易小时、价格与授权范围以书面订单为准。文中论文为第三方公开工作,并非拓比科技成果声明。配图来自拓比科技公开设备素材。