打开/关闭搜索
搜索
打开/关闭菜单
978
27
6
4034
Ac-Wiki
导航
首页
最近更改
随机页面
编辑指南
上传文件
联系我们
Discord
Telegram
QQ
打开/关闭外观设置菜单
无法加载偏好设置。请检查您的网络连接并重试。
重试
打开/关闭个人菜单
未登录
未登录用户的IP地址会在进行任意编辑后公开展示。
user-interface-preferences
个人工具
登录
网站测试中,如需帮助或提出建议
请
联系维护员
@天明
查看“︁多模态”︁的源代码
来自Ac-Wiki
查看
阅读
查看源代码
查看历史
associated-pages
页面
讨论
更多操作
←
多模态
因为以下原因,您没有权限编辑该页面:
您请求的操作仅限属于该用户组的用户执行:
用户
您可以查看和复制此页面的源代码。
多模态是指[[人工智能]]领域同时处理并融合多种数据类型(如文本、图像、音频、视频)的技术。其核心特点是能够跨模态进行理解与生成,实现更丰富的信息交互,常见应用包括视觉问答、图文检索、图像描述生成等。早期多模态研究以传统机器学习方法为主,2010年代后期随着[[Transformer]]架构兴起,模型如CLIP、DALL-E、Flamingo推动该领域快速发展。2023年以来,多模态大模型成为主流方向,被广泛应用于内容生成、自动驾驶、医疗影像分析等场景。
返回
多模态
。
查看“︁多模态”︁的源代码
来自Ac-Wiki