@kiou #11 差别还蛮大的啦,毕竟架构完全不一样!
@ #1 BTW,下篇实测不会用深度估计的相机,但是会测试在没有任何额外数据的条件下,用模型预测,或者用传统工具预测,做结合的输入,观察效果如何 毕竟有外部数据就太作弊了!
@ #1 好问题,这个是靠MLLM得到的信息,可以理解为llm前面有一个负责理解视觉的视觉编码器,位置信息是通过结合图像语义和LLM推断得到的。这个问题的难题在于模型必须在只有多张单目图像的情况下直接理解,不能取得深度信息或者点云的数据。我会在下一篇论证你说的关于深度信息参与,用传统CV实现SLAM之类的额外数据套LLM推理的想法