Deep Residual Learning for Image Recognition 思维导图

PDF · 12 页 · 109 个节点

你添加的是

1512.03385v1.pdf

PDF · 12 页

12 页 · 约 9,800 词 生成 109 个节点

原文摘录: Deep Residual Learning for Image Recognition Kaiming He Xiangyu Zhang Shaoqing Ren Jian Sun Microsoft Research {kahe, v-xiangz, v-shren, jiansun}@microsoft.com Abstract Deeper neural networks are more difficult to train. We

Deep Residual Learning for Image Recognition

He et al., arXiv:1512.03385

查看原文

可交互导图

导图预览:深度残差学习在图像识别中的应用正在加载可交互的导图…

拖动可平移,点击节点可折叠。

在编辑器中打开需免费账号

全部 109 个节点

以大纲形式展示完整导图。

深度残差学习在图像识别中的应用

  • 研究背景与动机
    • 深度神经网络的优势与挑战
      • 深度对于视觉识别任务的重要性
      • 梯度消失/爆炸问题阻碍深度网络训练
      • 训练误差增加但测试误差不降的反常“退化问题”
        • 增加层数导致训练误差升高
        • 并非过拟合引起
        • 当前优化器难以找到好的解决方案
    • 解决退化问题的必要性
  • 核心思想:残差学习
    • 提出残差学习框架
      • 将层定义为学习残差函数 H(x) - x,而非直接学习 H(x)
      • 核心假设:学习残差映射比学习非残差映射更容易
      • 形如 F(x) + x 的形式
    • 残差学习的理论基础
      • 理想情况下,若最优映射为恒等映射,易于将残差推向零
      • 预条件化作用:若最优函数接近恒等映射,则更容易找到扰动
    • 残差学习的实现
      • 通过“短连接”(Shortcut Connections)实现
      • 构成残差块(Building Block)
        • F(x, {Wi}) + x
        • F代表几层堆叠的非线性层
        • 短连接执行恒等映射(最常用)
        • 元素级相加
        • BN层放在卷积后、激活前
      • 维度匹配问题
        • 当输入输出维度不匹配时,使用线性投影(如1x1卷积)进行匹配
        • 恒等映射在匹配维度时也可能引入填充(Option A)
      • 残差函数F的形式
        • 两层或三层堆叠
        • 瓶颈(Bottleneck)设计:1x1, 3x3, 1x1卷积
  • 残差网络结构与实现
    • 网络架构设计
      • Plain Networks (对比基线)
        • 借鉴VGG网络思想
        • 3x3卷积为主,遵循输出特征图尺寸减半、滤波器数量加倍的规则
        • 34层Plain网络,计算量低于VGG-19
      • Residual Networks (ResNets)
        • 在Plain网络基础上插入短连接
        • 34层ResNet,参数量与34层Plain网络相同
        • 瓶颈结构用于更深的网络(ResNet-50/101/152)
          • 1x1降维、3x3、1x1升维
          • 恒等短连接对瓶颈结构尤为重要,避免参数和计算量翻倍
    • 实现细节
      • ImageNet数据集
        • 输入图像预处理(缩放、随机裁剪、翻转、减均值)
        • 批归一化 (BN)
        • 权重初始化
        • SGD优化器,学习率衰减策略
        • 无Dropout
        • 测试时采用10-crop或全卷积形式
      • CIFAR-10数据集
        • 简单架构,关注极深网络行为
        • 数据增强(填充、随机裁剪、翻转)
        • 训练参数设置
  • 实验与结果分析
    • ImageNet分类任务
      • 退化问题验证
        • Plain网络:18层优于34层
        • ResNet:34层优于18层,成功克服退化问题
      • 深度带来的增益
        • ResNet-34相比Plain-34错误率显著降低
        • ResNet-50/101/152相比Plain网络精度持续提升,无退化现象
      • 短连接类型比较
        • 恒等映射效果良好,投影映射提升有限
        • 恒等映射在瓶颈结构中优势明显
      • 残差函数响应分析
        • ResNet的层响应标准差(std)普遍较小
        • 深度越深,层响应幅度越小
    • CIFAR-10数据集
      • 验证退化问题在不同数据集上的普适性
      • ResNet同样能从深度中获益
      • 探索1000+层超深网络
        • 1202层网络训练误差极低,但测试误差不如110层,可能因过拟合
        • 强调模型深度与宽度而非强正则化
    • 泛化性分析
      • 极深残差网络在其他任务上的优势
  • 扩展应用与竞赛成绩
    • 目标检测 (PASCAL VOC & MS COCO)
      • ResNet-101替换VGG-16,mAP显著提升(COCO提升28%)
      • 综合多项改进(Box refinement, Global context, Multi-scale testing)
      • 在COCO 2015竞赛中获得目标检测第一名
    • 目标定位 (ImageNet Localization)
      • 基于RPN框架,引入逐类回归
      • ResNet-101相比VGG-16大幅降低定位误差
      • 在ImageNet 2015竞赛中获得定位任务第一名
    • 图像分割
      • 深度残差网络是其竞赛项目的基础
    • ILSVRC & COCO 2015竞赛成绩
      • ImageNet classification 1st place (3.57% test error ensemble)
      • ImageNet detection 1st place
      • ImageNet localization 1st place
      • COCO detection 1st place
      • COCO segmentation 1st place
  • 相关工作
    • 残差表示 (Residual Representations)
      • VLAD, Fisher Vector
      • 编码残差向量
    • 短连接 (Shortcut Connections)
      • 早期MLP中的线性层连接
      • 辅助分类器处理梯度问题
      • Highway Networks (与本文工作并行,但有门控机制)
        • 门控函数是数据依赖且有参数的
        • 本文的恒等短连接是无参数的
        • Highway Networks 未展示极深网络下的精度增益
    • 其他深度学习相关工作
      • Batch Normalization [16]
      • Caffe [19]
    Deep Residual Learning for Image Recognition 思维导图 - MindLM 生成