3. Metrics
업데이트 전 와 업데이트 후 는 서로 다른 두 개의 신경망으로 볼 수 있다. 이러한 관점에서 학습률의 선택을 '한 번의 step으로 신경망을 얼마나 멀리 이동시킬 것인가'라는 문제로 볼 수 있다.
일반적인 경사 하강법이 암묵적으로 전제하는 지표는 가중치 벡터의 유클리드 거리다. ( 는 학습률에 비례 ) 문제는 업데이트의 '보폭'을 잴 때, 가중치 공간의 유클리드 거리는 옳은 척도가 아니다. 어떤 방향은 모델에 미치는 영향이 적은 반면에, 어떤 방향은 큰 영향을 미치기 때문이다.
3.1 Motivation: Why Not Weight Space?
Note: 신경망이 아닐 땐, weight space 대신 parameter space로 지칭
유명한 toy 문제인 Rosenbrock function(로젠브록 함수)을 살펴보자.
위 함수를 구조로 분해하는 composite optimization(합성 최적화)를 통해 (비용 함수처럼) 분석할 수 있다.
다음은 경사 하강법에 따른 변화를 parameter space, output space에서 보여주는 그림이다.
-
(param) 벽 방향으로 움직이면, (output) 너무 많이 튕긴다.
-
(param) 골짜기 방향으로 움직이면, (output) 거의 변하지 않는다.
| parameter space | output space |
|---|---|
![]() |
![]() |
| 좁게 휘어진 골짜기(valley) | 완벽한 동심원 |
Note: 왜 출력이 급격하게 변화하면 안되는가?
강화 학습, 미세조정, 지식 증류 등: 기존의 해와 너무 멀어지지 않도록 학습해야 한다. (문제는, 유클리드 거리만으로는 알기 어렵다.)
그렇다면 output space에서 경사 하강법을 수행하면 어떨까?
3.1.1 GD on Output Space
문제는 출력 은 (파라미터와 달리) 직접 조절할 수 있는 변수가 아니다. 출력은 가중치 의 변화에 따라 결정되는 값이기 때문이다.
-
출력 공간에서 가중치를 최적화하려면 역함수 를 획득해야 한다.
-
그러나 신경망의 역함수는 존재할지 불분명하며, 있더라도 계산하기 어렵다.
그러므로 출력 공간에서의 경사하강법( )은 반칙(cheating)임에 주의하자.
| parameter space | output space |
|---|---|
![]() |
![]() |
그 대신, (반칙이 아닌) 파라미터 공간에서 비용 함수를 최적화하면서, 출력 공간에서의 변화량을 패널티로 참고하는 proximal optimization 아이디어로 이어진다.
3.2 Proximal Optimization
proximal point method은 최적화 과정에서 매 iteration의 거리 변화를 제약한다. (proximal operator)는 비용 함수 항과 패널티 항(proximity term) 으로 구성된다.
-
: 패널티 강도를 조절하는 하이퍼파라미터
-
: dissimilarity function(비유사도 함수)
먼저 패널티를 규정하는 비유사도 함수를 (계산하기 쉬운) 유클리드 거리로 두고, 어떻게 proximal optimization의 해를 구하는지 살펴볼 것이다.
- 후보 가중치 , 현재 iteration에서의 위치
: 엄밀히는 거리가 아니며, 거리 지표가 갖는 axioms를 모두 만족할 필요도 없다.
3.2.1 Proximal Point Method
다음은 비유사도 함수를 유클리드 거리로 둔 Rosenbrock 예제를 보여준다.
다음 빨간 선은 패널티 강도 를 에서 0으로 줄이며 매번 argmin 최적화를 했을 때, 해 가 그리는 궤적이다. 초록 등고선의 중심이 이며, 패널티의 강도가 줄어듦에 따라서 해의 궤적도 중심에서 멀어지게 된다.
-
: 패널티 극대화로
-
: 가 의 전역 최솟점으로 간다.

Note: 점선 해석
Rosenbrock 함수는 비볼록이며, 합산 함수에서는 국소 최솟값을 두 개 갖는다. 패널티 강도를 줄이다 보면 어느 임계치에서, (비용 감소에 더 유리한) 먼 곳의 국소 최솟값으로 건너뛰는 현상이 발생한다.
3.2.1.1 Implicit Gradient Descent
이제 해 를 구해 볼 것이다. 앞서 proximal operator는 조건, 즉 가 최솟점이고 기울기가 0인 상황을 전제한다.
- 식을 으로 정리한다.
주목할 부분은 정리한 식이 경사 하강법 형태라는 점이다. (차이는 양변의 가 미지수인 경사 하강법이다.) 미지수를 대상으로 하는 경사 하강법이므로 implicit gradient descent(암묵적 경사 하강법)이라 지칭한다.
가 미지수이므로,
를 어떻게 계산해야 할지가 난감해진다. (애초에
를 최소화하기 위한 과정인데, 이를 위해
를 매 스텝 최소화하는 게 전제조건인 셈이다.) 때문에, proximal optimization은 기본적으로 Taylor 근사로 단순화하여 계산한다.
- 이때 와 를 얼마나 단순화하는가에 따라, 크게 세 알고리즘으로 나뉜다. (정확도와 비용의 trade-off 고려)
| Approximation | ||
|---|---|---|
| Mirror descent | 1차 Taylor | 근사 X |
| Natural gradient descent | 1차 Taylor | 2차 Taylor ( 극한) |
| Damped Newton (Lecture 4) | 2차 Taylor | 2차 Taylor |
3.2.2 Approximation 1: Mirror Descent
mirror descent는 비용 만 선형화한다. 는 그대로 반영하므로 보폭이 커도 거리가 왜곡되지 않는 장점을 갖는다.
- 비용 함수만 1차 Taylor 근사
argmin 조건을 반영한다. (아직 비유사도 함수를 정하지 않았으므로, 비유사도 함수로 정리)
무엇보다 근사 없이 그대로 두는 에 대해, 닫힌 형태 해로 정리하여 해를 구할 수 있어야 한다. (유클리드 거리, KL divergence 등)
- e.g.1, 를 유클리드 거리로 둔 경우 (사실상 경사 하강법과 동일한 형태가 된다)
- e.g.2, 가 확률 벡터이고, 를 KL divergence로 둔 경우 (3.3절)
Note: 그러나 신경망의 출력을 확률 분포로 삼으면, 내부에 신경망을 포함하게 되어 닫힌 해가 존재하지 않는다.
3.2.3 Approximation 2: Natural Gradient
Natural Gradient는 비용의 1차 근사+비유사도 함수의 2차 근사 조합이다. (엄밀히는 비유사도 함수로 KL divergence를 사용할 때를 지칭, 3.3.2절)
한 가지 유의할 점은, '보폭이 작은 영역에서의 분석'을 전제로 한다. 극한 를 취할 때 (비용 항을 압도하므로) 가 된다. 이때 비유사도 함수를 2차 Taylor 근사한다.
- 이므로, 도 0이다. (상수항 drop, 최솟점이므로 1차항도 drop)
Note: metric matrix
비유사도 함수에서의 변화율을 나타내는 행렬 를 metric matrix라고 한다.
proximal operator를 두 근사로 치환하면 다음과 같다.
argmin을 반영하고 정리한다.
- 가 가중치 공간의 (제곱) 유클리드 거리이면, 이다. (즉, 보통의 경사 하강법이다.)
문제는 매 스텝마다 의 역을 구하는 선형 시스템을 풀어야 한다. (CG를 활용하거나, 를 근사하는 K-FAC 같은 기법을 활용한다.) 이는 역행렬이 가 positive definite여야 존재하는데, 실제로는 고유값이 0에 가까운 방향이 흔하다.
3.2.4 Approximation 3: Damped Newton
mirror descent, natural gradient: 비용 함수를 1차로 근사하므로, 곡률 정보가 버려진다.(골짜기처럼 비용이 다시 증가하는 구간에서 수렴이 늦어지게 된다.) 이번에는 비용을 2차 Taylor로 근사한 알고리즘을 살펴보자.
Note: damping
Newton 업데이트 가 불안정할 때, Hessian의 대각원소에 를 더해 안정화( )하는 기법을 damping이라고 한다.
를 유클리드 거리로 두면, damped Newton(Tikhonov damping)와 동일한 식이 된다.
비용과 비유사도 함수를 모두 2차 Taylor 근사하는 알고리즘은, (유클리드 거리의 특수 사례를 빼면) 별도의 명칭은 없다.
argmin을 반영한 수식은 다음과 같다. (비용의 2차 근사인 만큼 Hessian 이 등장한다.)
문제는 의 선형 시스템을 풀어야 한다.
- 가 유클리드 거리()인 경우 (damped Newton 업데이트라고 한다, Lecture 4)
특이사항으로 Damped Newton은 를 2차 Taylor 근사함에도 를 극한으로 보내지 않는다. (실전에서는 Levenberg–Marquardt 계열의 알고리즘으로 조절) 주목할 점은, damped Newton의 각 극한 사례는 대응하는 알고리즘이 존재한다. (damped Newton은 두 극한 사이를 보간하는 일반화된 알고리즘이다.)
| limit | behavior | description |
|---|---|---|
| Newton update (4.1.1절) | ||
| Natural gradient |
Note: 의 조절과 trust region 관계
허용 반경은 두 종류의 제약(soft, hard)으로 구현한다. (Lagrange 승수법으로 풀면 사실상 동일한 패널티다.)
- : 허용 반경(trust region radius)으로, 기준으로 떨어져도 되는 상한이다.
penalty description soft penalty 이동한 만큼, 설정한 패널티( )가 부가된다. hard constraint 설정한 제약( ) 안에서만 비용을 최적화할 수 있다.
(강화 학습의 TRPO 등에서 활용)
3.3 Fisher Information
Note: '정보량', '비유사도'는 덧셈 연산이 자연스럽다. 그리고 로그 확률을 사용하면, 확률 간 곱셈이 덧셈으로 변환된다. (log의 존재 의의)
분류기의 softmax 출력과 같은 확률 분포를 최적화할 때, 적합한 비유사도 함수인 KL divergence(Kullback–Leibler divergence)을 살펴보자.
Note: 거리 지표가 아니지만, KL divergence는 비유사도 함수로 적합하다.
성질 내용 axioms (거리와 달리) 대칭성, 삼각 부등식을 만족하지 않는다. nonnegative 이고, 일 때만 0이다.
( 일 때 최솟점인 지표로 활용 가능 )information theoretic interpretation relative entropy: 분포 의 데이터를 로 압축할 때 낭비되는 비트 수
(즉, 두 분포의 정보량을 비교하는 데 적절한 지표)Intrinsic 공식에 파라미터가 등장하지 않으며, 파라미터화 방식과 무관한 분포 자체의 거리다. (좌표계 불변성)
KL은 분포를 대상으로 하지만, 직접 최적화할 수 있는 대상은 파라미터뿐이다. 따라서, 파라미터 값에 따라 확률 분포가 정의되는 parameter family를 바탕으로 함수를 구성한다.
-
: 현재 파라미터 가 만드는 분포 (지금 네트워크의 출력 분포, softmax 등)
-
: 후보 값 에 분포가 배정한 확률(밀도)
-
: 후보 파라미터 가 만드는 분포 (파라미터가 이동했을 때 분포)
Note
e.g., 1차원 Gaussian family : 하나를 고르면 분포 하나가 결정된다. (3.3.2절)
- 로 정의했을 때 밀도 함수
그러나 앞서 언급처럼 신경망의 출력을 확률 분포로 삼으면, 내부에 신경망을 포함하게 되어 닫힌 해가 존재하지 않는다. 그러므로 를 2차 Taylor 근사하는 natural gradient를 활용해야 한다.
3.3.1 Fisher Information Matrix
Note:
이다. ( )
확률 분포의 적분은 1이므로, 이다. 그러므로 미분 이다. (일차 미분의 오른쪽 항)
metric matrix 를 계산해 보자. 이차 미분을 구해야 한다.
- 일차 미분
- 이차 미분
를 대입하면 첫 번째 적분 항은 0이 된다. 그리고 두 번째 적분항에
를 대입하면 수식은 공분산 형태가 된다.
-
: Fisher information matrix라고 정의한다.
-
: Fisher score라고 정의한다.
정리하자면 fisher scores는 후보 값 하나를 놓고, 각 파라미터를 조금씩 변화시킬 때 해당 값의 로그 확률이 얼마나 민감하게 변하는지를 기록한 벡터이다. 는 여러 후보 값에서 기록한 score가 얼마나 흩어져 있는지를 나타낸다.
비유사도 함수가 KL divergence가 아니더라도, '분포 사이의 거리'라고 부를 만한 표준적 후보는 대부분 Fisher로 수렴한다.
3.3.2 Example: Univariate Gaussian
Note:
: 파라미터의 변화 가, 후보 값 에서의 로그 확률에 미치는 변화
분포의 변화란 확률 질량의 재배치(어떤 후보 값의 확률은 오르고, 어떤 값에서는 내려간다.)를 의미한다. 다시 말해, 분포의 변화량은 의 분산이다.
다음은 1차원 Gaussian family 에서, 가 일정한 값을 평면 위에 표시한 그림이다.
유클리드로는 같은 거리 이동이라도, KL 기준으로는 전혀 다른 거리가 된다.
-
평균만 옮길 때의 KL은 닫힌 형태로 이다.
-
같은 이어도 표준편차가 이면 , 면 이다.
즉, 같은 유클리드 보폭이어도, 분포 변화량은 약 16배 차이가 발생한다.

앞서 3.2.3절의 수식에 Fisher information matrix를 대입한 수식을 natural gradient descent이라고 한다.
- : natural gradient
natural 용어 의미: KL divergence가 intrinsic한 성질 덕분에, 업데이트 방향은 어떤 좌표계를 쓰든 동일하다. (3.7절)



