AI与地理信息
无人机遥感与地理空间AI的视觉语言多模态学习:任务、数据集、基准与基础模型综述
完整中文导读
这篇综述系统梳理了面向无人机遥感与地理空间人工智能(GeoAI)的视觉语言多模态学习研究。作者提出多模态任务分类体系,涵盖图像文本检索、视觉定位、图像描述、视觉问答与多模态推理,并系统回顾代表性数据集、基准、模型架构与评测协议,总结地理空间基础模型与多模态大模型在地球观测和无人机应用中的近期进展。
论文资料与摘要整理
整理依据:原始摘要与元数据;未据此展示论文全文
Vision–Language Multimodal Learning for UAV-Based Remote Sensing and Geospatial Artificial Intelligence: Tasks, Datasets, Benchmarks, and Foundation Models
作者:Youla Yang
刊物:未提供
出版时间:2026-03-27
DOI:10.20944/preprints202603.2191.v1
研究方法
综述性研究,提出多模态任务分类体系并系统回顾数据集、基准、模型架构与评测协议
研究对象
无人机(UAV)遥感与地理空间人工智能(GeoAI)中的视觉语言多模态学习
主要发现
梳理了图像文本检索、视觉定位、图像描述、视觉问答与多模态推理等任务,总结了地理空间基础模型与多模态大模型在地球观测和无人机应用中的进展,并指出跨传感器域偏移、航空影像空间推理、时序建模、多模态对齐质量与可信部署等挑战
材料局限
材料仅提供摘要与元数据,未提供全文,具体数据集、基准数值与评测细节未在材料中给出
本文为来源内容的中文摘要与整理,不代表原文全文翻译。完整信息请查阅来源原文。