// research
이론적 아름다움과 유체역학으로 가지치기를 시도, NavierFlow
제 첫 연구 시도였고, 실패했습니다. 3월 말부터 5월 중순까지 신경망의 가지치기 기준을 유체역학에서 유도할 수 있는지 붙잡고 있었습니다. 결론부터 말하면 유도되는 수식은 예뻤지만, 실제로 유의미한 차이는 없었습니다.
질문
어떤 연결이 실제로 정보를 나르고 있는가. L1 가지치기는 가중치 크기 만 봅니다. Wanda(2023)는 가중치와 입력 활성화 크기 를 함께 보지만, 연결이 실제로 얼마나 흐르고 있는지, 곧 위상 자체는 모델링하지 않습니다.
여기서 신경망을 배관망으로 바꿔 보면 어떨까 했습니다. 가중치는 관, 데이터는 유체.
1단계 · DW-TOP
Darcy-Weisbach Topology Optimization. 기계공학의 위상최적화(SIMP)와 최소 기술 길이(MDL)를 유체역학 언어로 옮긴 프레임워크입니다.
대응은 이렇게 잡았습니다.
| 유체 | 신경망 |
|---|---|
| 유속 | 평균 활성화 크기 |
| 마찰계수 | 뉴런 생존 비율 |
| 관 지름 | 위상 밀도 , 학습 가능 |
연결 의 정보 유량을
로 정의하고, 를 SIMP식 연속 완화로 두었습니다. 를 키우면 로 Heaviside에 수렴합니다. 이 수렴은 증명했습니다.
임계값은 MDL Bernoulli prior에서 유도했습니다. flow의 절대 크기가 학습 중에 수 자릿수씩 바뀌므로 median으로 정규화해
로 두니 flow scale이 배 변해도 는 1배 이내로 안정했습니다. volume constraint 하이퍼파라미터가 사라졌습니다.
여기에 정보 병목(Information Bottleneck) 대응도 붙였습니다. 로 둔 DW-TOP 손실이 IB Lagrangian 의 변분 상한임을 보였습니다.
수식은 맞아떨어졌습니다. 그런데 학습되는 마스크가 목표 희소도를 못 잡았습니다. 목표 50%를 걸어도 실제 희소도는 1~2%에서 멈췄습니다. 같은 조건에서 그냥 L1 기준선은 50%, 70%, 90%를 다 깔끔하게 잡았고 정확도도 거의 안 떨어졌습니다.
2단계 · post-training으로 후퇴
마스크를 학습시키는 걸 포기했습니다. 대신 학습이 끝난 망에서 calibration 데이터만으로 한 번에 점수를 뽑는 방식(Wanda와 같은 부류)으로 바꿨습니다. 에너지 보존에서 유도하면
가중치 크기, 입력 운동에너지, 출력 마찰 소산의 곱입니다. 분포 가정이 없습니다.
3단계 · NavierFlow
여기서 유비가 제일 깔끔해졌습니다.
선형 레이어 는 선형 흐름망 와 대수적으로 같습니다. , , . 전기회로 도 같은 식입니다. 셋 다 의 물리적 구현일 뿐입니다.
활성화가 있으면 채널별 유효 전도도가 붙습니다.
Hagen-Poiseuille 에 하나만 가정하면 점수가
로 떨어집니다. 그리고 여기서 제일 마음에 들었던 결과 두 개.
Wanda는 NavierFlow의 층류 극한입니다. 이면 이라 , 순위로는 Wanda 점수 와 같습니다. Wanda가 왜 되는지에 대한 첫 이론적 설명이었습니다.
LayerNorm은 그 가정을 깹니다. LayerNorm과 RMSNorm은 pre-activation을 평균 0으로 맞추므로 , 따라서 , . Wanda가 암묵적으로 가정하는 층류()에서 한참 멀어집니다. 정규화된 LLM에서 Wanda가 고희소도에서 무너지는 이유가 수식으로 나왔습니다.
아래 수치는 vast.ai에서 OPT-1.3B와 LLaMA-3-8B를 WikiText-2로 직접 돌린 결과입니다(perplexity, 낮을수록 좋음).
| 모델 · 희소도 | Dense | Wanda | NavierFlow |
|---|---|---|---|
| OPT-1.3B · 50% | 14.62 | 19.08 | 18.34 |
| OPT-1.3B · 70% | 14.62 | 67.45 | 61.59 |
| OPT-1.3B · 90% | 14.62 | 6698 | 6399 |
| LLaMA-3-8B · 50% | 6.14 | 9.49 | 9.45 |
| LLaMA-3-8B · 70% | 6.14 | 121.72 | 121.89 |
| LLaMA-3-8B · 90% | 6.14 | 99,550 | 11,865 |
왜 실패인가
- 실제로 쓰는 희소도(50~70%)에서 Wanda 대비 개선폭이 사실상 무의미 했습니다. 19.08 → 18.34, 9.49 → 9.45.
- 큰 비율이 나오는 90% 구간은 perplexity가 양쪽 다 만 단위라 의미가 없었습니다.
- 전부 라는, 물리적 유도가 없는 가정 하나에 얹혀 있었습니다. 이걸 빼면 점수가 안 나옵니다.
- 진짜 망 동형이 되려면 채널 간 보존(Kirchhoff)이 필요한데, 공분산이 들어서 미해결로 남겼습니다. 단일 관 수준의 동형에서 더 나아가지 못했습니다.
배운 것은 제거의 비용을 그럴듯한 유비로 근사할 게 아니라 정확히 계산해야 한다는 것이었고, 그게 지금 foundational-theory 로 이어졌습니다.