HuggingFace Daily Papers(社区热门论文)
65
RoboStressBench:面向具身场景物理视觉压力的VLM鲁棒性基准测试
AI 摘要
RoboStressBench是一个用于评估视觉语言模型在具身场景中对物理视觉压力鲁棒性的基准测试。它从逆向图形学角度出发,将视觉压力系统性地分解为材质、视角、光照和几何四个基于物理的维度。该研究通过对先进模型的全面评估,揭示了特定压力下的失败模式,并发现不同物理因素对识别、推理和规划等能力的影响存在差异。此外,研究还引入了一种压力感知智能体求解器,它能在推理前检测视觉压力源并调用视觉编辑技能,以提升模型在复杂场景中的鲁棒性。
该来源未收录可展示正文,站内仅提供摘要。
阅读原文arxiv.org