왜 순환신경망이라고 이름 붙였을까요?

*그림 출처: https://blog.naver.com/PostView.nhn?blogId=winddori2002&logNo=221974391796

*그림 출처: https://m.health.chosun.com/svc/news_view.html?contid=2019060400005
예시: 아랜이는 어제 떡볶이를 먹었어요(시퀀스). 그리고 그녀는 오늘도 똑같은 음식을 먹었어요(시퀀스).
왜 시퀀스-투(보낸다)-시퀀스라고 이름 붙였을까요?

두 개의 RNN를 결합하여 인코더-디코더(Encoder-Decoder) 구조를 만듦.
문제점: 고정된 크기의 Representation Vector(Context Vector)를 사용하면 정보의 손실 발생
해결방법: 모든 단어를 같은 비중으로 압축하지 말고 중요한 단어만 더 큰 비중을 줘서 성능을 높이자!
왜 어텐션이라고 이름 붙였을까요?

*사진 출처: https://brunch.co.kr/@plutoun/24

*사진 출처: https://velog.io/@sujeongim/NLPSeq2Seq-with-Attention
예시: “김치찌개를 만드는 방법은 김치와 국간장을 넣고 계속 끓이는 것입니다.”

*사진 출처: 씨제이엔터테인먼트, 파라마운트픽처스, 공정 이용, https://ko.wikipedia.org/w/index.php?curid=1354988
“우리는 RNN과 CNN을 완전히 배제하고 Attention 메커니즘에만 기반을 둔 새롭고 단순한 구조인 Transformer를 제안합니다.” - Vaswani et al., 2017 -
NIPS-2017-attention-is-all-you-need-Paper.pdf

Vaswani et al., 2017
(비유)
Inputs
Input Embedding
Positional Encoding
Multi-Head Attention
(Position-wise) Feed Forward
Masked Multi-Head Attention
Add & Norm
Output Probabilities:
엄밀하게 말하면, Seq2Seq에서 제안된 인코더와 디코더(Encoder-Decoder) 구조를 사용함.