正文

梯度下降讲解（举例场景+数学分析）

sss-justddoit  sss-justddoit  2023-02-20  409

关键词：

本文将从一个下山的场景开始，先提出梯度下降算法的基本思想，进而从数学上解释梯度下降算法的原理，最后实现一个简单的梯度下降算法的实例！

梯度下降的场景假设

梯度下降法的基本思想可以类比为一个下山的过程。假设这样一个场景：一个人被困在山上，需要从山上下来(找到山的最低点，也就是山谷)。但此时山上的浓雾很大，导致可视度很低。因此，下山的路径就无法确定，他必须利用自己周围的信息去找到下山的路径。这个时候，他就可以利用梯度下降算法来帮助自己下山。具体来说就是，以他当前的所处的位置为基准，寻找这个位置最陡峭的地方，然后朝着山的高度下降的地方走，同理，如果我们的目标是上山，也就是爬到山顶，那么此时应该是朝着最陡峭的方向往上走。然后每走一段距离，都反复采用同一个方法，最后就能成功的抵达山谷。

我们同时可以假设这座山最陡峭的地方是无法通过肉眼立马观察出来的，而是需要一个复杂的工具来测量，同时，这个人此时正好拥有测量出最陡峭方向的能力。所以，此人每走一段距离，都需要一段时间来测量所在位置最陡峭的方向，这是比较耗时的。那么为了在太阳下山之前到达山底，就要尽可能的减少测量方向的次数。这是一个两难的选择，如果测量的频繁，可以保证下山的方向是绝对正确的，但又非常耗时，如果测量的过少，又有偏离轨道的风险。所以需要找到一个合适的测量方向的频率，来确保下山的方向不错误，同时又不至于耗时太多！

梯度下降

梯度下降的基本过程就和下山的场景很类似。

首先，我们有一个可微分的函数。这个函数就代表着一座山。我们的目标就是找到这个函数的最小值，也就是山底。根据之前的场景假设，最快的下山的方式就是找到当前位置最陡峭的方向，然后沿着此方向向下走，对应到函数中，就是找到给定点的梯度，然后朝着梯度相反的方向，就能让函数值下降的最快！因为梯度的方向就是函数之变化最快的方向(在后面会详细解释)
所以，我们重复利用这个方法，反复求取梯度，最后就能到达局部的最小值，这就类似于我们下山的过程。而求取梯度就确定了最陡峭的方向，也就是场景中测量方向的手段。那么为什么梯度的方向就是最陡峭的方向呢？接下来，我们从微分开始讲起

微分

看待微分的意义，可以有不同的角度，最常用的两种是：

函数图像中，某点的切线的斜率
函数的变化率
几个微分的例子：

上面的例子都是单变量的微分，当一个函数有多个变量的时候，就有了多变量的微分，即分别对每个变量进行求微分

梯度

梯度实际上就是多变量微分的一般化。
下面这个例子：

我们可以看到，梯度就是分别对每个变量进行微分，然后用逗号分割开，梯度是用<>包括起来，说明梯度其实一个向量。

梯度是微积分中一个很重要的概念，之前提到过梯度的意义

在单变量的函数中，梯度其实就是函数的微分，代表着函数在某个给定点的切线的斜率
在多变量函数中，梯度是一个向量，向量有方向，梯度的方向就指出了函数在给定点的上升最快的方向

这也就说明了为什么我们需要千方百计的求取梯度！我们需要到达山底，就需要在每一步观测到此时最陡峭的地方，梯度就恰巧告诉了我们这个方向。梯度的方向是函数在给定点上升最快的方向，那么梯度的反方向就是函数在给定点下降最快的方向，这正是我们所需要的。所以我们只要沿着梯度的方向一直走，就能走到局部的最低点！

梯度下降算法的数学解释

上面我们花了大量的篇幅介绍梯度下降算法的基本思想和场景假设，以及梯度的概念和思想。下面我们就开始从数学上解释梯度下降算法的计算过程和思想！

此公式的意义是：J是关于Θ的一个函数，我们当前所处的位置为Θ0点，要从这个点走到J的最小值点，也就是山底。首先我们先确定前进的方向，也就是梯度的反向，然后走一段距离的步长，也就是α，走完这个段步长，就到达了Θ1这个点！

下面就这个公式的几个常见的疑问：

α是什么含义？
α在梯度下降算法中被称作为学习率或者步长，意味着我们可以通过α来控制每一步走的距离，以保证不要步子跨的太大扯着蛋，哈哈，其实就是不要走太快，错过了最低点。同时也要保证不要走的太慢，导致太阳下山了，还没有走到山下。所以α的选择在梯度下降法中往往是很重要的！α不能太大也不能太小，太小的话，可能导致迟迟走不到最低点，太大的话，会导致错过最低点！

为什么要梯度要乘以一个负号？
梯度前加一个负号，就意味着朝着梯度相反的方向前进！我们在前文提到，梯度的方向实际就是函数在此点上升最快的方向！而我们需要朝着下降最快的方向走，自然就是负的梯度的方向，所以此处需要加上负号

梯度下降算法的实例

我们已经基本了解了梯度下降算法的计算过程，那么我们就来看几个梯度下降算法的小实例，首先从单变量的函数开始

单变量函数的梯度下降

我们假设有一个单变量的函数

技术分享图片

函数的微分

技术分享图片

初始化，起点为

学习率为

根据梯度下降的计算公式

我们开始进行梯度下降的迭代计算过程：

如图，经过四次的运算，也就是走了四步，基本就抵达了函数的最低点，也就是山底

多变量函数的梯度下降

我们假设有一个目标函数

现在要通过梯度下降法计算这个函数的最小值。我们通过观察就能发现最小值其实就是 (0，0)点。但是接下来，我们会从梯度下降算法开始一步步计算到这个最小值！
我们假设初始的起点为：

初始的学习率为：

函数的梯度为：

进行多次迭代：

我们发现，已经基本靠近函数的最小值点

梯度下降算法的实现

下面我们将用python实现一个简单的梯度下降算法。场景是一个简单的线性回归的例子：假设现在我们有一系列的点，如下图所示

我们将用梯度下降法来拟合出这条直线！

首先，我们需要定义一个代价函数，在此我们选用均方误差代价函数

此公示中

m是数据集中点的个数
?是一个常量，这样是为了在求梯度的时候，二次方乘下来就和这里的?抵消了，自然就没有多余的常数系数，方便后续的计算，同时对结果不会有影响
y 是数据集中每个点的真实y坐标的值
h 是我们的预测函数，根据每一个输入x，根据Θ 计算得到预测的y值，即

我们可以根据代价函数看到，代价函数中的变量有两个，所以是一个多变量的梯度下降问题，求解出代价函数的梯度，也就是分别对两个变量进行微分

明确了代价函数和梯度，以及预测的函数形式。我们就可以开始编写代码了。但在这之前，需要说明一点，就是为了方便代码的编写，我们会将所有的公式都转换为矩阵的形式，python中计算矩阵是非常方便的，同时代码也会变得非常的简洁。

为了转换为矩阵的计算，我们观察到预测函数的形式

我们有两个变量，为了对这个公式进行矩阵化，我们可以给每一个点x增加一维，这一维的值固定为1，这一维将会乘到Θ0上。这样就方便我们统一矩阵化的计算

然后我们将代价函数和梯度转化为矩阵向量相乘的形式

coding time

首先，我们需要定义数据集和学习率

import numpy as np

# Size of the points dataset.
m = 20

# Points x-coordinate and dummy value (x0, x1).
X0 = np.ones((m, 1))
X1 = np.arange(1, m+1).reshape(m, 1)
X = np.hstack((X0, X1))

# Points y-coordinate
y = np.array([
    3, 4, 5, 5, 2, 4, 7, 8, 11, 8, 12,
    11, 13, 13, 16, 17, 18, 17, 19, 21
]).reshape(m, 1)

# The Learning Rate alpha.
alpha = 0.01

接下来我们以矩阵向量的形式定义代价函数和代价函数的梯度

def error_function(theta, X, y):
    ‘‘‘Error function J definition.‘‘‘
    diff = np.dot(X, theta) - y
    return (1./2*m) * np.dot(np.transpose(diff), diff)

def gradient_function(theta, X, y):
    ‘‘‘Gradient of the function J definition.‘‘‘
    diff = np.dot(X, theta) - y
    return (1./m) * np.dot(np.transpose(X), diff)

最后就是算法的核心部分，梯度下降迭代计算

def gradient_descent(X, y, alpha):
    ‘‘‘Perform gradient descent.‘‘‘
    theta = np.array([1, 1]).reshape(2, 1)
    gradient = gradient_function(theta, X, y)
    while not np.all(np.absolute(gradient) <= 1e-5):
        theta = theta - alpha * gradient
        gradient = gradient_function(theta, X, y)
    return theta

当梯度小于1e-5时，说明已经进入了比较平滑的状态，类似于山谷的状态，这时候再继续迭代效果也不大了，所以这个时候可以退出循环！

完整的代码如下

import numpy as np

# Size of the points dataset.
m = 20

# Points x-coordinate and dummy value (x0, x1).
X0 = np.ones((m, 1))
X1 = np.arange(1, m+1).reshape(m, 1)
X = np.hstack((X0, X1))

# Points y-coordinate
y = np.array([
    3, 4, 5, 5, 2, 4, 7, 8, 11, 8, 12,
    11, 13, 13, 16, 17, 18, 17, 19, 21
]).reshape(m, 1)

# The Learning Rate alpha.
alpha = 0.01

def error_function(theta, X, y):
    ‘‘‘Error function J definition.‘‘‘
    diff = np.dot(X, theta) - y
    return (1./2*m) * np.dot(np.transpose(diff), diff)

def gradient_function(theta, X, y):
    ‘‘‘Gradient of the function J definition.‘‘‘
    diff = np.dot(X, theta) - y
    return (1./m) * np.dot(np.transpose(X), diff)

def gradient_descent(X, y, alpha):
    ‘‘‘Perform gradient descent.‘‘‘
    theta = np.array([1, 1]).reshape(2, 1)
    gradient = gradient_function(theta, X, y)
    while not np.all(np.absolute(gradient) <= 1e-5):
        theta = theta - alpha * gradient
        gradient = gradient_function(theta, X, y)
    return theta

optimal = gradient_descent(X, y, alpha)
print(‘optimal:‘, optimal)
print(‘error function:‘, error_function(optimal, X, y)[0,0])

运行代码，计算得到的结果如下

所拟合出的直线如下

原文链接：https://www.jianshu.com/p/c7e642877b0e

深度卷积网络原理—实例讲解梯度下降法参数更新过程

首先，先回顾梯度下降公式：（下面利用均方差MSE损失来进行演示）梯度下降的训练公式：接下来，按照上面的公式进行求最大值的案例讲解令，学习速率为0.1，初始化参数w1=0，w2=0... 查看详情

梯度下降算法原理讲解(代码片段)

...后都归结为求解最优化问题。在各种最优化算法中，梯度下降法是最简单、查看详情

梯度下降是什么

梯度是一个偏微分向量，有大小、有方向【梯度下降-探寻最优解】深度学习梯度下降法可视化讲解高中生都说懂！激活函数与Loss的梯度（深度学习/感知机/链式法则/随机梯度下降）_哔哩哔哩_bilibili 查看详情

随机梯度下降法的数学基础

梯度是微积分中的基本概念，也是机器学习解优化问题经常使用的数学工具（梯度下降算法）。因此，有必要从头理解梯度的来源和意义。本文从导数开始讲起，讲述了导数、偏导数、方向导数和梯度的定义、意义和数学公式，... 查看详情

梯度下降法

参考技术A本文主要是为了讲解梯度下降法的原理和实践，至于什么是梯度下降法，他能做什么，相信百度一下你就都知道了，所以下面进入正题梯度下降法主要是用来求解某个方程的最小值，这里我们以凹一元二次方程为例。... 查看详情

梯度下降深入浅出

查看原文请点这里在看Ng的ml课程，第二课中讲的是梯度下降算法。所以把与梯度下降算法有关的数学知识复习整理了一下便于自己理解。相信在不断的深入学习中对gradientdescent将会有更深更全面的了解，到时候我将不断补充本... 查看详情

adam梯度下降算法分析

(一)、什么是Adam算法?Adam（Adaptivemomentum）是一种自适应动量的随机优化方法（Amethodforstochasticoptimization），经常作为深度学习中的优化器算法。(二)、Adam算法如何实现？ ? 查看详情

数学基础详解——线性回归梯度下降对偶问题

查看详情

深度学习情感分析（随机梯度下降代码实现）

1.代码没有引入深度学习包，实现了简单的随机梯度下降算法。2.理论较简单。#coding:utf8#Author:Chazimportsys,timeimportnumpyasnpg=open("reviews.txt","r")reviews=list(map(lambdax:x[:-1],g.readlines()))g.close()f=open("labels.txt","r")label 查看详情

梯度下降法(代码片段)

在应用机器学习算法时，我们通常采用梯度下降法来对采用的算法进行训练。其实，常用的梯度下降法还具体包含有三种不同的形式，它们也各自有着不同的优缺点。下面我们以线性回归算法来对三种梯度下降法进行比较。一般... 查看详情

机器学习线性回归的损失和优化(代码片段)

...程求解举例2.1.3正规方程的推导推导方式一推导方式二2.2梯度下降(GradientDescent)2.2.1什么是梯度下降2.2.2梯度的概念2.2.3梯度下降举例2.2.4梯度下降（GradientDescent）公式3.梯度下降和正规方程的对比3 查看详情

机器学习梯度下降算法的实现及过程分析

机器学习（一）梯度下降算法因为算法最好能应用到实际问题中才会让读者感到它的真实的用处，因此首先我来描述一个实际问题（梯度下降算法用以帮助解决该问题）：给定一个指定的数据集，比如由若干某... 查看详情

[bpnet识别mnist05]神经网络梯度下降公式分析(代码片段)

写在前面我终于把神经网络的梯度下降公式推导完毕了！先看看为了伟大工程牺牲的草稿纸吧~接下来我就分享出我推导的公式以及我总结出来的规律。正文主要内容在我的古月居博客：[BPnet识别MNIST05]神经网络梯度下降... 查看详情

机器学习线性回归优化损失函数(代码片段)

...是正规方程2.1.2正规方程求解举例2.1.3正规方程的推导2.2梯度下降2.2.1什么是梯度下降2.2.2梯度的概念2.2.3梯度下降举例2.2.4梯度下降公式3梯度下降和正规方程的对比3.1两种方法对比3.2算法选择依据4小结1损失函数假设刚才的房子例... 查看详情

梯度下降算法

　这篇博文主要讲解下梯度与方向导数的关系、等值线图中梯度的表示，以及梯度的应用。因涉及太多高数的知识点，在此就不一一详述了，只是简单梳理下知识点，有所纰漏还望纠正指出，文末附有参考文献，借图。　一、方... 查看详情

1.人工智能的数学基础

目录1.高数1.1梯度问题：1.2凸函数问题与梯度下降1.2.1凸集与凸函数1.2.2梯度下降1.2.3梯度下降的参数求解1.2.4梯度下降步骤1.2.5迭代的终止条件1.2.6代码实现1.3求最优解的方法1.3.1梯度下降法1.3.2牛顿法1.3.3拟牛顿法1.3.4启发式优... 查看详情

梯度下降（gradientdescent）相关概念

梯度，直观理解：梯度:运算的对像是纯量,运算出来的结果会是向量在一个标量场中,梯度的计算结果会是"在每个位置都算出一个向量,而这个向量的方向会是在任何一点上从其周围(极接近的周围,学过微积分该知道甚么叫极限吧?)... 查看详情

机器学习100天（十七）：017逻辑回归梯度下降

机器学习100天，今天讲的是：逻辑回归-梯度下降！在讲解了逻辑回归的基本原理和损失函数之后，我们来推导逻辑回归模型中参数w和b的梯度表达式。我们之前介绍过，计算逻辑回归的代价函数实际上包含了下面三个过程：Z=WTX+... 查看详情