打开/关闭搜索
搜索
打开/关闭菜单
978
27
6
4034
Ac-Wiki
导航
首页
最近更改
随机页面
编辑指南
上传文件
联系我们
Discord
Telegram
QQ
打开/关闭外观设置菜单
无法加载偏好设置。请检查您的网络连接并重试。
重试
打开/关闭个人菜单
未登录
未登录用户的IP地址会在进行任意编辑后公开展示。
user-interface-preferences
个人工具
登录
网站测试中,如需帮助或提出建议
请
联系维护员
@天明
查看“︁Transformer”︁的源代码
来自Ac-Wiki
查看
阅读
查看源代码
查看历史
associated-pages
页面
讨论
更多操作
←
Transformer
因为以下原因,您没有权限编辑该页面:
您请求的操作仅限属于该用户组的用户执行:
用户
您可以查看和复制此页面的源代码。
Transformer 是一种基于自注意力机制的神经网络架构,由 Vaswani 等人在 2017 年论文《Attention Is All You Need》中首次提出。最初用于[[机器翻译]]任务,其核心特点是摒弃了循环和卷积结构,通过多头注意力机制并行处理序列数据,解决了长距离依赖问题。Transformer 后续被广泛应用于自然语言处理、[[计算机视觉]]、语音识别等领域,成为 [[BERT]]、[[GPT]] 等主流模型的基础架构。随着预训练范式的兴起,Transformer 推动了[[大语言模型|大规模语言模型]]的发展,并逐步拓展至[[多模态]]任务。
返回
Transformer
。
查看“︁Transformer”︁的源代码
来自Ac-Wiki