트랜스포머 2017 — 어텐션을 구조의 중심으로

2026-09-19 · 약 6분
AI역사TransformerAttentionNLP딥러닝
2014년 seq2seq와 어텐션의 문제 설정에서 2017년 트랜스포머 구조까지, 순환을 제거한 계산 방식과 논문 판본별 BLEU 수치 불일치를 함께 추적한다.

무슨 일이었나

2017년의 트랜스포머는 어텐션을 처음 발명한 사건이 아니라, 순환·합성곱 없이 어텐션을 시퀀스 변환 구조의 중심에 둔 번역 모델 제안이다.

핵심 요점

  • 트랜스포머 논문은 2017년 6월 arXiv에 제출됐고 같은 해 NIPS 프로시딩에 실렸다.
  • 트랜스포머는 번역을 위한 인코더-디코더 구조로 제안됐다.
  • 2017년의 핵심은 어텐션의 최초 발명이 아니라 어텐션 중심의 구조적 조합이다.
  • 순환과 합성곱을 기본 구조에서 제거해 위치별 계산의 순차 경로를 없애려 했다.

순환 없이 시퀀스를 변환하겠다는 제안

2017년 6월 12일 구글 브레인·구글 리서치 연구자 여덟 명은 「Attention Is All You Need」 를 arXiv에 제출했다. 같은 논문은 그해 NIPS 2017 프로시딩에 실렸다. 논문이 제안한 트랜스포머(Transformer) 는 당시 기계번역 모델의 뼈대였던 순환 신경망과 합성곱을 빼고, 입력·출력 위치 사이의 관계를 어텐션으로 계산하는 인코더-디코더 구조다.

이는 어텐션의 발명과 같은 말이 아니다. 2014년 신경 기계번역 연구는 이미 순환형 인코더-디코더에 어텐션을 붙여 고정 길이 벡터의 병목을 다뤘다. 2017년의 새 주장은 그 보조 장치를 구조의 중심으로 옮기고, 표상을 만들 때 시퀀스 순서대로 계산하는 순환을 제거할 수 있다는 데 있었다.

AI 역사 연재 — 1. 신경망에서 LLM·VLM까지 · 2. 다트머스 워크숍 1956 · 3. ImageNet과 AlexNet 2012 · 4. 트랜스포머 2017 · 5. ChatGPT 2022

seq2seq와 어텐션

2014년 seq2seq는 문장을 고정 길이 벡터에 담는 LSTM 번역을, Bahdanau 등의 어텐션은 그 압축 병목을 겨냥한 순환형 번역 모델의 구성요소를 제안했다.

핵심 요점

  • 2014년 seq2seq는 LSTM 인코더·디코더와 고정 길이 벡터를 사용했다.
  • seq2seq 논문은 영어→프랑스어에서 34.8 BLEU와 통계 번역 기준선 33.3 BLEU를 보고했다.
  • Bahdanau 등의 어텐션은 고정 길이 벡터 병목을 겨냥했다.
  • 어텐션은 트랜스포머보다 앞서 순환형 번역 모델에서 제안됐다.
  • 순차적 의존성은 문장 안 병렬화를, 메모리 제약은 여러 문장의 배치 처리를 각각 제한했다.

고정 길이 벡터의 병목에서 출발하다

2014년 9월 수츠케버·비니알스·르의 seq2seq 논문은 다층 LSTM 인코더가 입력 문장을 고정 차원 벡터로 바꾸고, 다른 LSTM 디코더가 그 벡터에서 번역문을 생성하는 방식을 제안했다. 저자들은 WMT'14 영어→프랑스어 전체 테스트셋에서 34.8 BLEU, 같은 데이터의 구문 기반 통계 번역 시스템에서 33.3 BLEU를 보고했다.

바다나우·조·벤지오는 목표 단어를 만들 때 원문의 관련 부분을 부드럽게 찾아 더 큰 가중치를 주는 방법을 제안했다. 이것이 뒤에 어텐션이라 불린 장치다. 따라서 어텐션은 트랜스포머보다 앞서 존재했고, 처음에는 순환을 없애는 장치가 아니라 순환형 번역 모델이 모든 정보를 하나의 고정 길이 벡터에 압축하지 않도록 돕는 구성요소였다.

트랜스포머 논문이 문제로 삼은 것은 이 순환의 계산 순서다. 현재 위치의 은닉 상태가 바로 앞 위치에 의존하면 문장 안의 위치들을 순서대로 계산해야 한다. 이 순차적 의존성은 문장 안의 병렬화를 제한한다. 별도로 메모리 제약은 여러 문장을 배치로 묶어 처리할 수 있는 양을 제한한다고 논문은 진단했다.

트랜스포머 구조

6층 인코더와 6층 디코더, 다중 헤드 셀프어텐션, 위치별 피드포워드망, 위치 인코딩이 순환 없이 문장 안 관계와 순서 정보를 함께 다룬다.

핵심 요점

  • 기본 트랜스포머는 6층 인코더와 6층 디코더로 구성된다.
  • 기본 모델은 8개 헤드의 다중 헤드 어텐션을 사용했다.
  • 셀프어텐션은 같은 시퀀스 내 위치들 사이의 관계를 가중합으로 계산한다.
  • 위치 인코딩은 순환을 제거한 구조에 토큰 순서 정보를 넣으며, 학습된 위치 임베딩도 결과가 거의 같게 시험됐다.
  • 저자들은 학습 때보다 긴 시퀀스로 일반화할 가능성 때문에 사인·코사인 위치 인코딩을 택했다.

셀프어텐션으로 관계를, 위치 인코딩으로 순서를

논문의 기본 구조는 인코더 6층과 디코더 6층이다. 각 인코더 층에는 다중 헤드 셀프어텐션과 위치별 완전연결 피드포워드망이 있고, 각 하위 층 둘레에는 잔차 연결과 층 정규화가 있다. 디코더에는 이 둘에 더해 인코더 출력에 대한 어텐션이 들어간다. 기본 모델은 서로 다른 관계를 병렬로 계산하도록 어텐션 헤드 8개를 사용했다.

스케일드 닷프로덕트 어텐션은 질의(query)와 키(key)의 내적을 키 차원의 제곱근으로 나누고, 소프트맥스 결과를 값(value)의 가중치로 쓴다. 다중 헤드 방식은 이 계산을 서로 다른 학습된 투영 공간에서 병렬로 수행한 뒤 결과를 합친다. 셀프어텐션은 같은 시퀀스의 각 위치가 다른 위치들과 관계를 맺게 한다.

순환과 합성곱이 없으면 토큰 순서가 구조에 자동으로 들어 있지 않다. 저자들은 입력 임베딩에 서로 다른 주기의 사인·코사인 값을 더하는 위치 인코딩을 사용했다. 학습된 위치 임베딩도 시험했지만 결과가 거의 같았고, 학습 때보다 긴 시퀀스로 일반화할 가능성 때문에 사인·코사인 방식을 택했다고 적었다. 제목과 달리 이 모델에 어텐션만 있는 것은 아니다. 임베딩·위치 인코딩·피드포워드망·잔차 연결·층 정규화·소프트맥스가 함께 있으며, 제목이 압축한 주장은 순환과 합성곱이 시퀀스 변환의 기본 연산일 필요는 없다는 것이다.

결과와 파급

논문이 직접 보고한 범위는 기계번역과 영문 구문구조 분석이다. 뒤의 BERT·GPT 계열과의 연결은 후속 계보이지 2017년 논문이 직접 입증한 결과가 아니다.

핵심 요점

  • 트랜스포머 논문이 직접 다룬 과제는 기계번역과 영문 구문구조 분석이다.
  • 일반 셀프어텐션의 층별 계산량은 시퀀스 길이의 제곱에 비례한다.
  • WMT 2014 영어→독일어 big 모델은 28.4 BLEU로 보고됐다.
  • BERT·GPT 계열과의 연결은 2017년 논문 뒤에 이어진 계보다.

번역 논문에서 후속 언어 모델 계보까지

논문이 직접 입증한 범위는 기계번역과 영문 구문구조 분석이다. 셀프어텐션 층은 한 층에서 모든 위치를 잇는 데 필요한 순차 연산 수가 상수이므로, 위치 수에 따라 순차 연산이 늘어나는 순환층보다 병렬화에 유리했다. 다만 논문의 계산표에서 일반 셀프어텐션의 층별 계산량은 시퀀스 길이의 제곱에 비례한다. 긴 입력에서 언제나 더 싸다는 뜻은 아니다.

저자들은 WMT 2014 영어→독일어에서 big 모델이 28.4 BLEU를 기록했고, 앙상블을 포함한 당시 기존 최고 결과보다 2 BLEU 이상 높다고 보고했다. 이 수치는 과제·언어쌍·모델 크기에 묶인 결과다.

그 뒤 BERT·GPT 계열은 트랜스포머를 언어 모델의 뼈대로 삼았다. 그러나 이는 후속 계보다. 2017년 문서는 대규모 언어 모델을 발표한 문서가 아니며, 학습 데이터도 WMT 번역 말뭉치였다. 구조가 사전학습 언어 모델과 시각-언어 모델로 옮겨 간 더 긴 흐름은 연재 1편에서 다룬다.

수치

학습량·하드웨어·번역 점수는 과제와 판본을 떼어 읽을 수 없다. 특히 영어→프랑스어 41.0과 41.8 BLEU는 판본 및 같은 판본 내부에서도 불일치한다.

핵심 요점

  • 영어→독일어 학습 자료는 약 450만 문장쌍, 영어→프랑스어는 3,600만 문장이었다.
  • 학습에는 P100 GPU 8개를 사용했고 기본·big 모델의 보고된 시간은 각각 약 12시간·3.5일이다.
  • 프로시딩과 arXiv v1은 영어→프랑스어 big 모델을 41.0 BLEU로 적는다.
  • arXiv v7은 초록·표 2의 41.8 BLEU와 6.1절 산문의 41.0 BLEU가 서로 다르다.

조건을 붙여 읽는 번역 점수

WMT 2014 영어→독일어 학습 자료는 약 450만 문장쌍, 영어→프랑스어는 3,600만 문장이었다. 모델들은 한 대의 기계에 연결한 NVIDIA P100 GPU 8개로 학습했다. 기본 모델은 10만 스텝·약 12시간, big 모델은 30만 스텝·3.5일이 걸렸다고 논문은 적는다.

영어→프랑스어 big 모델의 BLEU는 판본을 구분해야 한다. 발행 당시 NIPS 프로시딩과 arXiv v1은 41.0 BLEU를 적는다. 2023년의 arXiv v7은 초록과 표 2에 41.8 BLEU를 적지만, 같은 v7 PDF의 6.1절 산문에는 41.0 BLEU가 남아 있다.

따라서 이 글은 41.0 BLEU와 41.8 BLEU 중 어느 하나를 근거 없이 우선하거나, 하나의 매끈한 확정 수치로 합치지 않는다. 프로시딩, arXiv 최초 제출판(v1), 2023년 판(v7)은 서로 다른 기록이며 v7 내부에도 불일치가 있다. 41.8이 어떤 후속 실험 조건을 뜻하는지는 이 출처만으로 확인하지 못했다. 확인 필요.

판본·논쟁·출처와 연재

‘어텐션만’, 최초성, LLM의 탄생이라는 해석은 논문의 제한된 주장과 후대의 계보를 구분해 읽어야 하며, 수치의 판본 차이도 출처 자체의 일부다.

핵심 요점

  • ‘Attention Is All You Need’는 모델의 모든 구성요소가 어텐션이라는 뜻이 아니다.
  • 최초성은 저자들이 ‘자신들이 아는 한’이라고 한정한 주장이다.
  • 트랜스포머는 후속 LLM의 구조적 기반이지만 2017년 논문은 번역 논문이다.
  • 프로시딩·arXiv v1·arXiv v7을 구분하는 일은 BLEU 수치를 읽는 데 필수다.

제목, 우선권, 후대의 결과를 분리하기

‘어텐션만’이 전부였는가. 제목을 문자 그대로 읽으면 피드포워드망과 위치 인코딩 같은 구성요소가 사라진다. 논문의 대조 대상은 모든 신경망 연산이 아니라 순환과 합성곱이다. 이 사건의 핵심은 어텐션 하나의 발명보다, 시퀀스 모델의 순차 계산 경로를 없앤 구조적 조합이다.

최초의 트랜스포머였는가. 저자들은 자신들이 아는 한, 시퀀스 정렬 RNN이나 합성곱 없이 입력과 출력의 표상을 셀프어텐션으로 계산한 첫 변환 모델이라고 썼다. 이것은 저자들의 한정된 우선권 주장이다. 이 글은 선행 연구 전체를 독립적으로 판정한 과학사 문헌을 확보하지 못했다. 확인 필요.

LLM의 탄생이었는가. 트랜스포머는 뒤의 LLM이 사용한 구조지만 2017년 사건은 번역 모델 논문이다. BERT의 사전학습, GPT-3의 규모, 사람 피드백, ChatGPT의 대화 인터페이스는 각각 뒤에 더해진 층이다. 출처도 프로시딩·arXiv v1·arXiv v7을 분리해 보존하며, 판본 간 수치 불일치를 감추지 않는다.

AI 역사 연재 — 1. 신경망에서 LLM·VLM까지 · 2. 다트머스 워크숍 1956 · 3. ImageNet과 AlexNet 2012 · 4. 트랜스포머 2017 · 5. ChatGPT 2022

이 글은 AI 리서치 파이프라인으로 작성되고 사람이 검수했습니다. 섹션마다 1차 출처를 표기합니다.