01 / 探索 · 本科毕业论文
测试多模态 LLM 的具身空间导航能力
LLM 能像小孩一样,在动态的 3D 世界里找到路吗?
在剑桥本科毕业论文中,我使用 Animal-AI 测试多模态 LLM 智能体,并以 4–7 岁儿童作为发展性参照。
- 7 种实验条件
- 168 个 Gemini 测试回合
- 儿童成功率 89.6% · 智能体成功率 45.8%
结果仅适用于本研究所使用的模型、提示词与实验框架设置、任务和样本。
研究问题
受测的多模态 LLM 智能体可以用文字描述一条看似合理的路线。我想知道,当它必须在遵循物理规则的 3D 世界中,把计划转化为实际动作时,会发生什么。
实验分别改变了绕行难度、目标是否暂时被遮挡,以及地标的类型。智能体需要完成一整个感知与行动循环:看见环境、决定下一步、执行动作,再根据新的观察调整判断。
我的工作
我设计并执行了这项比较研究,通过 API、借助现有的 Python LLM-AAI 实验框架接入模型;先用 Claude 和 Gemini 进行预实验,再选择 Gemini 进入主实验。我负责收集 LLM 实验数据、使用 SPSS 分析结果,并结合回放与推理记录复盘失败过程。
实验场景和儿童数据均为已有研究资产。我独立分析了完成去标识化的儿童数据,并将其与新收集的 LLM 实验数据进行比较。
实验系统
看见 → 思考 → 前进 / 转向 → 再次观察
每个测试回合都从第一人称画面和环境状态开始。模型可以先用 Think 生成推理记录,再通过 Go 或 Turn 行动;所有动作和结果都会被记录下来。
研究发现
在汇总比较中,儿童的成功率为 89.6%,受测 Gemini 智能体为 45.8%;儿童成功的 odds 是受测智能体的 10.15 倍。
不过,这种差异并没有在所有条件下保持一致。绕行带来的表现下降在统计校正后不再显著;在本次设置中,额外遮挡和地标类型也没有稳定改变智能体的成功率。
回放往往比单一分数更有意思:智能体可以描述一条看似合理的路线,却在执行时转错角度;也会把地标认成坡道,或反复撞向无法移动的障碍物。
会计划,不等于会走路。
我的收获
智能体的表现并不只取决于文字中的推理记录。视觉感知、提示词、动作控制和环境反馈都会影响结果。下一轮研究需要进一步对齐儿童与智能体的观察方式、练习机会和动作控制,才能进行更公平的比较。