首页
AI工具
AI音频助手
AI办公助手
AI学习论文
AI代码编程
AI电商助手
AI教程资讯
08AI导航网
2025-07-10
据 Arxiv 页面显示,微软近日联手加州大学等高校,共同发布一款多模态大模型产品 MM-Navigator。
MM-Navigator基于 GPT-4V打造,可用于零镜头智能手机 GUI 导航任务。通过使用 MM-Navigator,智能手机屏幕可以像人类用户一样进行交互,并确定后续行动以完成给定的指示。
研究发现,多模态大模型在零镜头 GUI 导航方面表现出色,尤其是 GPT-4V,它具有先进的屏幕解释、行动推理和精确行动定位能力。
最新录入 更多
悟空图像
Photosir 工具箱
Pokecut-AI驱动的在线照片编辑器
千图AI设计室-AI助手
Midjourney Art AI
VisualizeAI
UIED-AI学习平台
Pixso AI