- RNN은 은닉 상태(hidden state) 에 과거를 누적해 시퀀스를 처리하지만, 기울기 소실·폭발로 장기 의존성에 약하다.
- LSTM(게이트 + 셀 상태) / GRU(게이트 축소, 더 가볍고 빠름)가 그 약점을 완화한다.
- seq2seq(인코더-디코더)는 고정 컨텍스트 벡터의 정보 병목이 문제였고, 어텐션이 이를 해소했다.
- Transformer는 순환 없이 셀프 어텐션만으로 처리해 병렬 학습과 장거리 의존성에 강하다(BERT/GPT/T5).
- AWS 매핑: 시계열=DeepAR/Forecast, 텍스트=BlazingText/Comprehend, 생성=JumpStart/Bedrock.
이미지에 공간 구조가 있다면, 텍스트·시계열·음성·로그에는 순차 구조가 있다. 앞선 입력이 다음 출력에 영향을 주는 이런 데이터에는 순환 신경망(RNN)과 그 발전형, 그리고 오늘날의 주류인 Transformer를 쓴다.