[논문 리뷰] Deep Residual Learning for Image Recognition

2025. 10. 12. 22:24·네이버 AI Tech 8기
728x90

논문

Deep Residual Learning for Image Reconition (2015)


0. keyword

Residual Learning, Identity Shortcut

 

1. What is new in the work 

  • 이 논문은 기존의 심층 신경망 학습 방식을 바꾼 Residual Learning 프레임워크를 제안한다. 
  • 기존의 입력 x를 통해 출력인 H(x)를 학습하는 대신, 각 층이 입력과의 차이(잔차)인 F(x) = H(x) - x 만 학습하도록 바꾸었다. 
  • 이를 위해 shortcut connection을 도입해, 출력 y = F(x) + x 형태로 입력을 그대로 다음 층에 더해준다. 
  • 이 단순한 구조로 100층 이상의 깊은 네트워크도 안정적으로 학습이 가능해졌다. 

 

2. Why is the work important

  • 이전의 신경망(VGG 등) 층을 깊게 쌓으면 오히려 성능이 나빠지는 degradation 문제를 해결해, 더 깊은 모델에서 학습 용이성과 정확도 개선을 달성
  • 152층 단일 모델/앙상블로 ILSVRC 2015 분류 1위(Top-5 3.57%)를 달성하고, 탐지/국소화/세그멘테이션 등 다른 과제에도 일반화되는 표현을 제공.

 

3. What is the literature gap

ResNet 이전의 모델들은,

  • 층이 깊어질수록 학습 오류가 커짐(학습 자체가 어려워짐)
  • 기울기 소실(vanishing gradient) 문제로 학습 불안정
  • 연산량은 급격히 늘어나는데, 성능 향상은 제한적

 

4. How is the gap filled

  • 항등 경로를 두고(지름길), 학습해야 할 것은 차이(잔차)만으로 재정식화 
    • 최적화 난이도 감소 (항등이 최적이면 F(x) -> 0으로 수렴시키면 된다. )
  • identity shortcut은 무매개변수라서 파라미터/연산 증가 없이 공정 비교가 가능하고, 
    • 가중치나 파라미터가 추가되지 않는다. (= 연산량이나 학습해야 할 값이 늘어나지 않는다. ) 
  • 입력과 출력의 크기가 달라, 필요 시 1x1 conv(합성곱)으로 차원만 맞춘다. (projection shortcut) 

 

5. What is achieved with the new method

    • Imagenet 분류: ResNet-152 단일 모델 Top-5 4.49%, 앙상블 Top-5 3.57%(테스트), 기존 최고 성능 초과 및 1위.
    • 깊이 효과: 34층 대비 50/101/152층에서 일관된 성능 향상, 성능 저하 현상 없음
    • CIFAR-10: 20~110층까지는 깊어질수록 정확도 개선, 1202층까지도 학습 안정적(훈련오차 <0.1%).
    • 객체 탐지/분할 전이: VGG-16→ResNet-101 교체만으로 COCO mAP@[.5,.95] +6.0pt(상대 28%), VOC/COCO/ILSVRC 탐지·국소화 등 다수 트랙 1위

 

 

6. What data are used

  • ImageNet 2012 분류: 1000 클래스, 훈련 128만, 검증 5만, 테스트 10만.
  • CIFAR-10: 훈련 5만, 테스트 1만, 10 클래스.
  • PASCAL VOC 2007/2012: 07+12, 07++12 설정으로 학습/평가
  • MS COCO: 80 클래스, train 8만 / val 4만으로 평가

 

 

7. What are the limitations

  • 초심층(1200+층) 소규모 데이터에서는 과적합 가능
    • CIFAR-10에서 1202층 모델이 110층보다 테스트 오차가 큼(훈련오차는 유사).
    • 이는 과적합으로 해석되며, 더 강한 정규화(예: dropout, maxout) 가 필요할 수 있음
  • projection shortcut의 효과는 제한적
    • projection, 1x1 conv을 추가해도 성능 향상은 소폭에 그침
  • gate 기반 모델 highway networks 대비 확장성 차이 
    • 게이트를 사용하는 구조는 데이터에 따라 경로를 조절할 수 있으나, ResNet의 identity shortcut은 항상 열려 있어서 유연성은 낮다. 그러나 매개변수가 없고 훨씬 단순하고 효율적이다는 장점이 있음 

 

 

 

 

반응형

'네이버 AI Tech 8기' 카테고리의 다른 글

[네이버 AI Tech 8기] Week 6 회고  (0) 2025.10.17
[네이버 AI Tech 8기] Week 5 회고  (0) 2025.10.10
[네이버 AI Tech 8기] Week 4 회고  (0) 2025.09.26
[네이버 AI Tech 8기] Week 3 회고  (0) 2025.09.19
[네이버 AI Tech 8기] Week 2 회고  (0) 2025.09.12
'네이버 AI Tech 8기' 카테고리의 다른 글
  • [네이버 AI Tech 8기] Week 6 회고
  • [네이버 AI Tech 8기] Week 5 회고
  • [네이버 AI Tech 8기] Week 4 회고
  • [네이버 AI Tech 8기] Week 3 회고
zo0oz
zo0oz
꾸준함 기르기
  • zo0oz
    우당탕탕굴러가는하루
    zo0oz
  • 전체
    오늘
    어제
  • 블로그 메뉴

    • 🏠 Home
    • 📑 Tag
    • Github
    • 분류 전체보기 (286)
      • 네이버 AI Tech 8기 (7)
      • 🚩 Coding Test (203)
        • Baekjoon (94)
        • Programmers (43)
        • Code Tree (34)
        • SWEA (19)
        • HackerRank (2)
        • SQL (8)
      • 🇱 Languages (4)
        • Python (4)
      • 🇫 Framework (2)
        • fastAPI (2)
      • 🤖 AI (9)
        • LLM (1)
        • Computer Vision (2)
      • 📈 Data-Science (10)
        • Pandas (4)
        • 파이썬으로 시작하는 데이터 사이언스 (6)
      • 🛠️ 형상관리 (6)
        • Git (6)
      • 💥 Projects (13)
        • 개인실습 (12)
        • 실습 (0)
      • 🏆 자격증 (25)
        • 정보처리기사 (10)
        • ADsP (1)
        • SQLD (13)
      • 🔎 etc (2)
        • 2024 하반기 (0)
  • 인기 글

  • hELLO· Designed By정상우.v4.10.0
zo0oz
[논문 리뷰] Deep Residual Learning for Image Recognition
상단으로

티스토리툴바