뉴럴 탄젠트 커널: 딥러닝 미스터리를 파헤치는 핵심 열쇠!
신경망 학습, 왜 잘 될까? 🤔
신경망은 엄청나게 많은 숫자(가중치)를 가지고 있는데, 이걸 배우게 하려고 주는 데이터는 몇 개 안 돼. 원래대로라면 이건 완전 엉망진창이 되어야 해. 숫자가 너무 많아서 뭘 배워야 할지 모르고, 그냥 답을 외워버릴 수도 있거든.
근데 신기하게도, 그냥 경사 하강법이라는 걸로 학습시키면 손실(틀린 정도)이 거의 0까지 뚝뚝 떨어져. 마치 땅이 평평해진 것처럼 말이야.
경사 하강법, 어떻게 작동하는 걸까?
경사 하강법은 각 숫자를 조금씩 바꿔가면서 손실을 가장 많이 줄이는 방향으로 움직이는 거야. 마치 산에서 가장 낮은 곳으로 내려가는 것처럼 말이지.
이때 연쇄 법칙이라는 게 있어서, 복잡한 신경망에서도 각 숫자가 얼마나 바뀌어야 하는지 계산할 수 있게 해줘. 그리고 역전파라는 걸로, 맨 처음에 틀렸던 게 얼마나 잘못됐는지 알아내서 각 숫자를 얼마나 바꿔야 할지 알려주는 거지.
신경망이 선형 모델처럼 보인다고?
놀랍게도, 신경망이 학습하는 과정은 마치 선형 모델처럼 볼 수도 있대. 선형 모델은 입력값에 따라 출력이 정해지는 간단한 모델인데, 신경망도 학습이 진행될수록 입력값에 대한 출력 변화가 마치 선형 모델처럼 예측 가능해진다는 거야.
이걸 신경망 접선 커널이라고 하는데, 학습 전의 신경망이 입력값에 얼마나 민감하게 반응하는지를 나타내는 거야.
넓은 신경망은 왜 더 잘 작동할까?
연구에 따르면, 신경망의 너비(층에 있는 뉴런 개수)가 충분히 넓으면, 이 신경망 접선 커널이 학습 후에도 거의 변하지 않는대. 마치 처음부터 완벽한 상태로 시작한 것처럼 말이야.
이게 왜 좋냐면, 넓은 신경망에서는 수많은 숫자들이 조금씩 움직여서 전체적인 결과는 크게 바뀌지만, 각 숫자는 아주 조금만 움직여도 돼. 그래서 복잡한 산길을 헤매지 않고도 안정적으로 최저점을 찾아갈 수 있는 거지.
실제 신경망은 좀 다르지만...
물론 실제 신경망은 이론처럼 완벽하게 커널이 고정되지는 않아. 하지만 이 신경망 접선 커널 이론 덕분에, 왜 복잡해 보이는 신경망이 안정적으로 학습되는지 이해할 수 있게 된 거지. 마치 처음부터 잘 만들어진 도구를 가지고 시작하는 것처럼 말이야.
결론적으로, 신경망이 잘 학습되는 이유는 넓은 너비와 안정적인 학습 과정 덕분이라고 할 수 있어!