全微分与梯度

f ( x , y ) 是一个二元函数。假设第一个变量 x 改变了 d x ,第二个变量改变了 d y 。那么函数在新点的值为 f ( x + d x , y + d y ) 。函数值改变量为

f ( x + d x , y + d y ) f ( x , y )

这个表达式是四个变量 x , y , d x , d y 的函数。它被称为 f ( x , y ) 全微分,简记为 d f

d f = f ( x + d x , y + d y ) f ( x , y )

全微分通常用“无穷小量”来讨论,这个术语指的是 d x d y 。然而,从未给出过无穷小量的恰当定义。我们能够处理 d x d y 的唯一方法是把这些量当作,这正是我们所做的。人们也常写成

d f = f x d x + f y d y ,

其中 f x f y f x ( x , y ) f y ( x , y ) 。我们将看到这实际上只是一个近似公式,并且我们将对其应用中的误差有一些了解。使用这个公式没有任何问题,只要按这种意义来解释它。

现在让我们重新考察全微分。首先,我们把 d f = f ( x + d x , y + d y ) f ( x , y ) 写成

f ( x + d x , y + d y ) f ( x + d x , y ) + f ( x + d x , y ) f ( x , y )

然后应用中值定理得到

d f = f y ( x + d x , η ) d y + f x ( ξ , y ) d x ,

其中 ξ 介于 x x + d x 之间, η 介于 y y + d y 之间。我们假设 f x f y 连续的。那么

f y ( x + d x , η ) f y ( x , y ) = α ( d x , d y ) ,

其中 α ( d x , d y ) d x 2 + d y 2 趋于零时趋于零(因为 ( x + d x , η ) 位于以 ( x , y ) , ( x + d x , y ) , ( x + d x , y + d y ) , ( x , y + d y ) 为顶点的矩形内,所以当矩形的对角线 d x 2 + d y 2 趋于 0 时,它趋于 ( x , y ) )。同样地,

f x ( ξ , y ) f x ( x , y ) = β ( d x , d y )

d x 2 + d y 2 趋于 0 时趋于 0 。我们的公式现在变为

d f = f x ( x , y ) d x + f y ( x , y ) d y + β ( d x , d y ) d x + α ( d x , d y ) d y

现在,如果 ϵ > 0 是任意小的正数,我们可以选取 d x d y ,使得 d x 2 + d y 2 足够小,以致 | α ( d x , d y ) | < ϵ | β ( d x , d y ) | < ϵ ,因为这正是“这些量当 d x 2 + d y 2 趋于零时趋于零”这一陈述的含义。那么我们有

现在 | d x | + | d y | 2 d x 2 + d y 2 ,因此当 d x d y 选得足够小时,用 f x ( x , y ) d x + f y ( x , y ) d y 近似全微分的误差满足

误差 d x 2 + d y 2 < 2 ϵ d x 2 + d y 2 d x 2 + d y 2 = 2 ϵ

换言之,

误差 d x 2 + d y 2 0 当  d x 2 + d y 2 0

这正是我们说“误差与 d x 2 + d y 2 相比是小的”时所要表达的意思。于是我们的结果如下:

d f = f x ( x , y ) d x + f y ( x , y ) d y ,

其误差与 d x 2 + d y 2 相比是小的。这就是正确解释该公式的意义所在。

上式中出现的表达式 f x d x + f y d y 可以用向量记号表示为标量积

( f x , f y ) ( d x , d y )

在二维情形下没有多少理由这样做。然而,我们可以定义 n 元函数 f ( x 1 , x 2 , , x n ) 的全微分为量

f ( x 1 + d x 1 , x 2 + d x 2 , , x n + d x n ) f ( x 1 , x 2 , , x n ) ,

这是一个 2 n 元函数,并且可以像上面那样证明

d f = ( f x 1 , f x 2 , , f x n ) ( d x 1 , d x 2 , , d x n ) + 误差

其中误差与

d x 1 2 + d x 2 2 + + d x n 2

相比是小的。我们把向量 ( d x 1 , d x 2 , , d x n ) 记作 d X ,把向量 ( f x 1 , f x 2 , , f x n ) 记作 grad f(称为“ 𝒇 的梯度”)。在这种记号下,我们有

d f = ( grad  f ) d X + 误差 ,

其中误差与 | d X | 相比是小的。

现在换一种情形,设 f ( x , y , z ) 是一个三元函数,并设这三个变量都是单个变量 t 的函数 x ( t ) , y ( t ) , z ( t ) 。那么 g ( t ) = f ( x ( t ) , y ( t ) , z ( t ) ) t 的函数,我们可以研究 。为此,我们必须考虑

g ( t + h ) g ( t ) h = f ( x ( t + h ) , y ( t + h ) , z ( t + h ) ) f ( x ( t ) , y ( t ) , z ( t ) ) h

现在令 d x = x ( t + h ) x ( t ) , d y = y ( t + h ) y ( t ) , d z = z ( t + h ) z ( t ) ;那么我们有

g ( t + h ) g ( t ) h = d f h = ( grad  f ) d X h + 误差 h .

现在

1 h d X = ( x ( t + h ) x ( t ) h , y ( t + h ) y ( t ) h , z ( t + h ) z ( t ) h ) ,

因此

误差项具有 α d x + β d y + γ d z 的形式,其中 α , β γ | d X | 趋于零时趋于零。当 h 0 时, | d X | 0 ,因为假设了 x ( t ) , y ( t ) , z ( t ) 连续。于是

误差

如垂直箭头所示。

代入 g ( t ) ,我们得到公式

这是多元函数链式法则的三元情形。(在 f ( x ( t ) ) 的情形下,它就简化为 ,正如我们之前所看到的。)

习题

习题 1.

f ( x , y ) 是一个二元函数。假设存在一个正数 M ,使得在 ( x 0 , y 0 ) 的某个邻域内, f x f y 存在,并且对所有 ( x , y ) 都有 | f x ( x , y ) | < M , | f y ( x , y ) | < M 。通过考虑全微分,证明 f ( x , y ) ( x 0 , y 0 ) 处连续。然后利用这个结果证明:如果 f x f y ( x 0 , y 0 ) 处连续,则 f ( x , y ) 在该点也连续。