@kiou #11 差别还蛮大的啦,毕竟架构完全不一样!
我以为会跟我玩的ComfyUI里面的sd或者flux一样呢
专门注册账号来评价一下。我也是研究AI的。但是第一次再galgame 网站看到有人发论文解读的
答案:B: front right
推理过程
1. 核心参照物分析:两张图的共同固定物体是橙色毛巾和墙上的开关,是判断位置的关键。
- 第一张图:橙色毛巾在画面左下角(你的左前方近处),开关在画面左侧墙上(你的左前方远处),书架在画面中间偏左(你的前方偏左)。
- 第二张图:橙色毛巾在画面右下角(你的右前方近处),开关在画面右侧墙上(你的右前方远处)。
2. 相机运动判断:原本在你左前方的物体,…
@ #1
BTW,下篇实测不会用深度估计的相机,但是会测试在没有任何额外数据的条件下,用模型预测,或者用传统工具预测,做结合的输入,观察效果如何
毕竟有外部数据就太作弊了!
@ #1
好问题,这个是靠MLLM得到的信息,可以理解为llm前面有一个负责理解视觉的视觉编码器,位置信息是通过结合图像语义和LLM推断得到的。这个问题的难题在于模型必须在只有多张单目图像的情况下直接理解,不能取得深度信息或者点云的数据。我会在下一篇论证你说的关于深度信息参与,用传统CV实现SLAM之类的额外数据套LLM推理的想法
这个好像是纯靠llm来得到空间位置信息?如果有深度相机的话,用传统cv方法做slam再往上套个llm识别会不会好一点
@ #3
AI会不能理解图像发生了平移,以及旋转的确切角度,他们分析的时候基本都是角度变化超过90度,我怀疑是因为参照物的问题,就是下面的那个橙色椅子发生的角度变化的同时包含了位移,AI在没有确切提示的情况下很容易误分析
@ #2
我们人的正常视觉分辨看起来就是右前方,答案应该是没错的,这是我的理解(悲
给的答案多数都是C,应该是AI不能准确分辨拍摄中心水平线在哪个方位,所以给出了大致准确的答案
怎么 GPT, Gemini, Claude 都阵亡了😭😭😭