鲲 Galgame 论坛
发布
话题
Galgame
其他
发售月历题库
GitHub
image
xiaohuo

xiaohuo 私聊

普通用户正常

这里是小火哟 最近在忙着收拾旧的论文工作,就先歇歇了,新工作开始以后会开始扫读新论文,所以就会开始更新了!

注册于 2023-10-29
160
萌萌点
3
话题
0
Galgame
0
评分
25
被赞
5
被推
xiaohuo
xiaohuo普通用户
话题 3Galgame 0 萌萌点 160
动态收藏话题Galgame关于
动态收藏话题Galgame关于

话题

查看全部
每周一篇 - MMSI-BENCH:多图下的空间智能基准测试
2026-03-06
趣味小测试 - 来试试你日常使用的模型空间感知能力如何吧~
2026-02-27
每周一篇 - 以编程视觉思考:迈向图像思维的统一视角
2026-02-19

回复

查看全部
@kiou #11 差别还蛮大的啦,毕竟架构完全不一样!
2026-07-04
@YoucanBaby #7 嘿嘿
2026-07-04
@ #1 BTW,下篇实测不会用深度估计的相机,但是会测试在没有任何额外数据的条件下,用模型预测,或者用传统工具预测,做结合的输入,观察效果如何 毕竟有外部数据就太作弊了!
2026-03-09
@ #1 好问题,这个是靠MLLM得到的信息,可以理解为llm前面有一个负责理解视觉的视觉编码器,位置信息是通过结合图像语义和LLM推断得到的。这个问题的难题在于模型必须在只有多张单目图像的情况下直接理解,不能取得深度信息或者点云的数据。我会在下一篇论证你说的关于深度信息参与,用传统CV实现SLAM之类的额外数据套LLM推理的想法
2026-03-06