ImageNet과 AlexNet 2012 — 데이터·대회·GPU가 만난 전환점
무슨 일이었나
핵심 요점
- ImageNet 데이터셋은 2009년, ILSVRC 대회는 2010년부터, AlexNet 제출은 2012년의 일이다.
- 논문에는 ‘AlexNet’이라는 이름이 없고 제출 팀명은 SuperVision이다.
- 15.3%는 일곱 CNN 앙상블과 외부 사전학습 조건이 붙은 top-5 테스트 오류율이다.
- 주최 측 표의 16.4%와 15.3%는 외부 데이터 사용 여부가 다른 SuperVision 결과다.
데이터·대회·모델을 한 날짜로 뭉개지 않기
2012년 캐나다 토론토대의 알렉스 크리제브스키·일리야 수츠케버·제프리 힌턴이 학습한 합성곱 신경망은 ILSVRC-2012에서 주목할 만한 결과를 냈다. 뒷날 이 망은 제1저자 이름을 따 AlexNet이라 불렸지만, 논문에는 그 이름이 없고 대회 팀 이름은 SuperVision이었다.
이 사건은 세 층을 구분해 읽어야 한다. ImageNet은 2009년에 공개된 데이터셋, ILSVRC는 2010년부터 매년 열린 대회, AlexNet은 2012년에 그 대회에 제출된 GPU 학습 모델이다. 따라서 2012년은 데이터셋의 시작 연도도, 대회의 시작 연도도 아니다.
논문 PDF의 ILSVRC-2012 표에서 일곱 CNN 예측을 평균한 제출은 top-5 테스트 오류율 15.3%, 2위 SIFT+FV 접근은 **26.2%**였다. 다만 이 15.3%에는 2011년 가을판 ImageNet 전체로 사전학습한 두 모델이 포함된다. 주최 측 표는 외부 데이터 없이 낸 SuperVision 제출을 16.4%로, 외부 데이터를 쓴 제출을 15.3%로 따로 적는다.
AI 역사 연재 — 1. 신경망에서 LLM·VLM까지 · 2. 다트머스 워크숍 1956 · 3. ImageNet과 AlexNet 2012 · 4. 트랜스포머 2017 · 5. ChatGPT 2022
데이터셋·대회·직전 기준선
핵심 요점
- 2009년 ImageNet 논문은 당시 5,247개 개념·320만 장을 보고했다.
- ILSVRC는 2010년부터 매년 열렸으며 top-5 오류율은 다섯 추측에 정답이 없는 비율이다.
- 우승 top-5 오류율은 2010년 28.2%, 2011년 25.8%였고 두 해 차이는 2.4%p다.
- 2012년 2위 SIFT+FV는 사람이 설계한 특징을 쓰는 접근이었다.
2009년의 자료, 2010년의 비교장
2009년 CVPR에서 지아 덩·페이페이 리 등은 WordNet의 위계에 웹 이미지를 연결한 ImageNet을 발표했다. 목표는 WordNet의 약 8만 명사 개념 대부분에 평균 500~1,000장의 정제된 고해상도 이미지를 채우는 것이었다. 당시 보고한 판은 12개 하위 트리, 5,247개 개념, 320만 장이었고 검증에는 Amazon Mechanical Turk 작업자가 쓰였다. 이는 2009년 데이터셋 논문의 수치다.
그 일부로 2010년부터 매년 열린 ILSVRC는 수백 개 물체 범주와 수백만 장의 이미지에 걸친 분류·검출 벤치마크였다. 분류에서 top-5 오류율은 모델의 다섯 예측 안에 정답이 없었던 비율이다. 우승 팀의 top-5 오류율은 **2010년 NEC 연구소·일리노이대 팀 28.2%, 2011년 제록스 유럽연구센터 팀 25.8%**였다. 2.4%p 개선 뒤에 2012년 결과가 놓인다.
2012년 2위는 여러 조밀 표본 특징의 Fisher vector로 학습한 분류기 예측을 평균한 접근, 결과표의 SIFT + FVs였다. 즉 사람이 설계한 특징 기술자와 분류기를 잇는 방식이었다. 이 방식이 2000년대에 어떻게 주류가 됐는지는 이 글의 출처로 확인하지 못했다. 확인 필요. 합성곱 구조의 더 이른 계보는 1980년 후쿠시마의 네오코그니트론에서 볼 수 있다.
AlexNet의 구성과 학습
핵심 요점
- AlexNet 논문은 6천만 파라미터·65만 뉴런·합성곱 5층·완전연결 3층을 기술한다.
- 학습은 1,000개 범주의 약 120만 장을 사용한 지도학습이었다.
- GTX 580 3GB 두 장에 망을 나눠 올렸고 학습은 5~6일 걸렸다.
- 중간 층 하나를 없애면 top-1 성능이 약 2% 나빠진다는 보고가 깊이의 역할을 뒷받침한다.
6천만 파라미터를 GPU 두 장에 나누다
논문이 기술한 망은 파라미터 6천만 개·뉴런 65만 개, 합성곱 5층과 완전연결 3층, 마지막 1,000-way 소프트맥스로 구성됐다. 학습 데이터는 1,000개 범주의 약 120만 장이었다. 저자들은 포화하지 않는 뉴런, 효율적인 GPU 합성곱 구현, 과적합을 줄이는 드롭아웃을 사용했고 비지도 사전학습은 쓰지 않았다고 밝혔다.
설계는 하드웨어 제약과 맞물렸다. GTX 580 한 장의 메모리가 3GB라서 망을 두 GPU에 분할했고, NVIDIA GTX 580 3GB 두 장으로 학습하는 데 5~6일이 걸렸다. 저자들은 망 크기가 주로 GPU 메모리와 감내 가능한 학습 시간에 제한된다고 적었다.
깊이도 결과의 일부였다. 저자들은 중간 층 하나를 없애면 top-1 성능이 약 2% 나빠진다고 보고했다. 그러므로 2012년의 설명은 새 구조 하나만이 아니라 깊은 망, 대규모 라벨 데이터, GPU 메모리와 구현의 결합이다.
결과와 그 뒤 3년
핵심 요점
- 외부 데이터 없는 SuperVision의 2012년 16.4%는 2011년 우승 25.8%보다 9.4%p 낮다.
- 2013년 Clarifai 11.7%, 2014년 GoogLeNet 6.7%는 같은 ILSVRC 분류 과제의 우승 top-5 오류율이다.
- 2014년 제출은 36개 팀 123건이었고, 2013년 24개 팀보다 팀 수가 1.5배였다.
- ResNet 앙상블의 3.57%는 2015년 ImageNet 테스트 top-5 오류율·ILSVRC 분류 우승이라는 조건의 수치다.
점수 곡선이 내려간 2012~2015년
주최 측 회고는 ILSVRC-2012를 대규모 물체 인식의 전환점, 대규모 심층 신경망이 등장한 때로 기록한다. 외부 데이터 없는 SuperVision의 16.4%는 전년도 우승 25.8%보다 9.4%p 낮다. 이는 2010년과 2011년 우승 사이의 2.4%p 개선보다 약 네 배 큰 차이다. 이 비교에서도 16.4%와 외부 데이터 사용 15.3%를 섞지 않는다.
같은 분류 과제의 우승 top-5 오류율은 **2013년 Clarifai 11.7%, 2014년 Google의 GoogLeNet 6.7%**였다. 2014년에는 36개 팀이 123건을 제출해, 24개 팀이던 2013년보다 참가 팀 수가 1.5배가 됐다. 주최 측은 2010년 28.2%에서 2014년 6.7%로의 하락을 요약했다.
2015년 12월 카이밍 허 등은 최대 152층의 잔차망을 발표했고, 그 앙상블이 ImageNet 테스트 **top-5 오류율 3.57%**로 ILSVRC 2015 분류 과제 1위를 했다고 보고했다. 저자들은 이를 VGG보다 8배 깊다고 설명한다. 2012년의 8층과 2015년의 최대 152층은 같은 시기 모델 규모 변화를 보여 주지만, 서로 다른 모델·연도·앙상블 조건의 결과다.
수치: 무엇의 오류율인가
핵심 요점
- PDF의 15.3%는 외부 사전학습 두 모델을 포함한 일곱 CNN 앙상블의 top-5 테스트 오류율이다.
- 단일 CNN 18.2%와 다섯 CNN 평균 16.4%는 검증 top-5 오류율이라는 다른 조건의 수치다.
- ILSVRC-2010 테스트의 37.5% top-1·17.0% top-5와 NeurIPS 초록의 39.7%·18.9%는 다른 연도·판본 조건을 구분해야 한다.
- 5.1% 사람 오류율은 훈련받은 주석자 A1 한 명·테스트 이미지 1,500장이라는 제한된 추정치다.
같은 논문, 다른 판본과 다른 조건
이 글은 논문 PDF를 수치의 정본으로 삼는다. PDF의 2012년 **15.3% 대 26.2%**는 일곱 CNN 평균과 2위 SIFT+FV의 top-5 테스트 오류율이다. 그 일곱 CNN 중 둘은 2011년 가을판 ImageNet 전체(1,500만 장·2만 2천 범주)로 사전학습했다. 같은 표에서 단일 CNN의 검증 top-5 오류율은 18.2%, CNN 다섯 개 평균은 **16.4%**다.
논문 PDF 초록의 **ILSVRC-2010 테스트 top-1 오류율 37.5%·top-5 오류율 17.0%**도 2012년 대회 결과가 아니라 그 이전 대회의 테스트 조건 수치다. NeurIPS 프로시딩의 초록 페이지는 같은 논문에 top-1 39.7%·top-5 18.9%·뉴런 50만 개·전역 연결층 둘을 적고 ILSVRC-2012 결과를 언급하지 않는다. PDF는 65만 뉴런·완전연결층 셋을 적는다. PDF 수치가 본문 표와 주최 측 기록에 맞아 이 글은 PDF를 따르지만, 두 판본이 갈린 경위는 확인하지 못했다. 확인 필요.
‘사람 오류율 5.1%’도 일반적인 인간 능력의 한 숫자가 아니다. 이는 훈련받은 주석자 A1 한 명이 테스트 이미지 1,500장에 대해 낸 추정치다. 같은 표본에서 GoogLeNet은 6.8%, 다른 주석자 A2는 12.0%였다. 한편 2014년 8월 ImageNet 전체는 21,841개 synset과 14,197,122장이었고, 대회는 그중 1,000개 범주의 부분집합을 썼다.
논쟁, 출처, 연재
핵심 요점
- 2012년의 의미는 사실관계보다 어느 대회와 데이터셋을 역사적 분기점으로 볼지의 해석을 포함한다.
- 슈미트후버의 2011년 대회 서술은 그 2011년 시스템 논문의 공저자가 쓴 관점이다.
- 알고리즘·데이터·GPU의 기여 비중을 단정할 출처는 이 글에 없다.
- ImageNet의 웹 이미지 목록과 ILSVRC의 난이도 비판은 벤치마크 점수의 한계를 보여 준다.
시작인가, 전환점인가, 규모의 결과인가
‘딥러닝의 시작’인가. 주최 측은 2012년을 전환점으로 부른다. 반면 위르겐 슈미트후버의 개관은 GPU로 학습한 맥스풀링 CNN 앙상블의 ImageNet 최고 성적을 더 긴 계보에 놓고, 같은 계열이 2011년 IJCNN 교통표지 대회에서 이미 0.56% 오류율로 초인적 시각 패턴 인식을 달성했다고 주장한다. 그는 그 2011년 시스템 논문의 공저자이므로 이해 당사자의 서술임을 밝혀야 한다. 두 서술의 차이는 어느 대회·데이터셋을 분기점으로 삼는가에 있다.
알고리즘·데이터·하드웨어 중 무엇의 공인가. 합성곱과 역전파는 새롭지 않았고, 2012년에는 120만 장의 라벨 데이터와 GPU가 함께 있었다. 저자들 자신도 GPU 메모리와 학습 시간을 한계로 적었다. 세 요소의 기여 비중을 가르는 학술 출처는 이 글에서 확보하지 못했다. 확인 필요.
점수는 무엇을 재는가. 주최 측은 ILSVRC 데이터셋이 충분히 도전적이지 않다는 비판도 주요 비판으로 기록한다. 한 벤치마크의 오류율 하락과 시각 인식 문제가 풀렸다는 말은 같지 않다. ImageNet은 이미지 저작권을 소유하지 않고 WordNet synset별 웹 이미지 목록을 엮는다고 밝힌다. 이 데이터셋은 웹 자료 학습과 권리·프라이버시 문제도 함께 남겼다.
AI 역사 연재 — 1. 신경망에서 LLM·VLM까지 · 2. 다트머스 워크숍 1956 · 3. ImageNet과 AlexNet 2012 · 4. 트랜스포머 2017 · 5. ChatGPT 2022