Deep Residual Learning for Image Recognition 思维导图
PDF · 12 页 · 109 个节点
你添加的是
1512.03385v1.pdf
PDF · 12 页
12 页 · 约 9,800 词 生成 109 个节点
原文摘录: Deep Residual Learning for Image Recognition
Kaiming He Xiangyu Zhang Shaoqing Ren Jian Sun
Microsoft Research
{kahe, v-xiangz, v-shren, jiansun}@microsoft.com
Abstract
Deeper neural networks are more difficult to train. We
可交互导图
正在加载可交互的导图…拖动可平移,点击节点可折叠。
在编辑器中打开需免费账号
全部 109 个节点
以大纲形式展示完整导图。
深度残差学习在图像识别中的应用
- 研究背景与动机
- 深度神经网络的优势与挑战
- 深度对于视觉识别任务的重要性
- 梯度消失/爆炸问题阻碍深度网络训练
- 训练误差增加但测试误差不降的反常“退化问题”
- 增加层数导致训练误差升高
- 并非过拟合引起
- 当前优化器难以找到好的解决方案
- 解决退化问题的必要性
- 深度神经网络的优势与挑战
- 核心思想:残差学习
- 提出残差学习框架
- 将层定义为学习残差函数 H(x) - x,而非直接学习 H(x)
- 核心假设:学习残差映射比学习非残差映射更容易
- 形如 F(x) + x 的形式
- 残差学习的理论基础
- 理想情况下,若最优映射为恒等映射,易于将残差推向零
- 预条件化作用:若最优函数接近恒等映射,则更容易找到扰动
- 残差学习的实现
- 通过“短连接”(Shortcut Connections)实现
- 构成残差块(Building Block)
- F(x, {Wi}) + x
- F代表几层堆叠的非线性层
- 短连接执行恒等映射(最常用)
- 元素级相加
- BN层放在卷积后、激活前
- 维度匹配问题
- 当输入输出维度不匹配时,使用线性投影(如1x1卷积)进行匹配
- 恒等映射在匹配维度时也可能引入填充(Option A)
- 残差函数F的形式
- 两层或三层堆叠
- 瓶颈(Bottleneck)设计:1x1, 3x3, 1x1卷积
- 提出残差学习框架
- 残差网络结构与实现
- 网络架构设计
- Plain Networks (对比基线)
- 借鉴VGG网络思想
- 3x3卷积为主,遵循输出特征图尺寸减半、滤波器数量加倍的规则
- 34层Plain网络,计算量低于VGG-19
- Residual Networks (ResNets)
- 在Plain网络基础上插入短连接
- 34层ResNet,参数量与34层Plain网络相同
- 瓶颈结构用于更深的网络(ResNet-50/101/152)
- 1x1降维、3x3、1x1升维
- 恒等短连接对瓶颈结构尤为重要,避免参数和计算量翻倍
- Plain Networks (对比基线)
- 实现细节
- ImageNet数据集
- 输入图像预处理(缩放、随机裁剪、翻转、减均值)
- 批归一化 (BN)
- 权重初始化
- SGD优化器,学习率衰减策略
- 无Dropout
- 测试时采用10-crop或全卷积形式
- CIFAR-10数据集
- 简单架构,关注极深网络行为
- 数据增强(填充、随机裁剪、翻转)
- 训练参数设置
- ImageNet数据集
- 网络架构设计
- 实验与结果分析
- ImageNet分类任务
- 退化问题验证
- Plain网络:18层优于34层
- ResNet:34层优于18层,成功克服退化问题
- 深度带来的增益
- ResNet-34相比Plain-34错误率显著降低
- ResNet-50/101/152相比Plain网络精度持续提升,无退化现象
- 短连接类型比较
- 恒等映射效果良好,投影映射提升有限
- 恒等映射在瓶颈结构中优势明显
- 残差函数响应分析
- ResNet的层响应标准差(std)普遍较小
- 深度越深,层响应幅度越小
- 退化问题验证
- CIFAR-10数据集
- 验证退化问题在不同数据集上的普适性
- ResNet同样能从深度中获益
- 探索1000+层超深网络
- 1202层网络训练误差极低,但测试误差不如110层,可能因过拟合
- 强调模型深度与宽度而非强正则化
- 泛化性分析
- 极深残差网络在其他任务上的优势
- ImageNet分类任务
- 扩展应用与竞赛成绩
- 目标检测 (PASCAL VOC & MS COCO)
- ResNet-101替换VGG-16,mAP显著提升(COCO提升28%)
- 综合多项改进(Box refinement, Global context, Multi-scale testing)
- 在COCO 2015竞赛中获得目标检测第一名
- 目标定位 (ImageNet Localization)
- 基于RPN框架,引入逐类回归
- ResNet-101相比VGG-16大幅降低定位误差
- 在ImageNet 2015竞赛中获得定位任务第一名
- 图像分割
- 深度残差网络是其竞赛项目的基础
- ILSVRC & COCO 2015竞赛成绩
- ImageNet classification 1st place (3.57% test error ensemble)
- ImageNet detection 1st place
- ImageNet localization 1st place
- COCO detection 1st place
- COCO segmentation 1st place
- 目标检测 (PASCAL VOC & MS COCO)
- 相关工作
- 残差表示 (Residual Representations)
- VLAD, Fisher Vector
- 编码残差向量
- 短连接 (Shortcut Connections)
- 早期MLP中的线性层连接
- 辅助分类器处理梯度问题
- Highway Networks (与本文工作并行,但有门控机制)
- 门控函数是数据依赖且有参数的
- 本文的恒等短连接是无参数的
- Highway Networks 未展示极深网络下的精度增益
- 其他深度学习相关工作
- Batch Normalization [16]
- Caffe [19]
- 残差表示 (Residual Representations)