[Sutskever's List 스터디] RNN의 dropout 위치와 CTC 학습, 디코딩을 직접 계산해 본 기록RNN의 dropout 위치와 CTC 학습, 디코딩을 직접 계산해 본 기록앞선 글 「AlexNet의 계산량, ResNet의 기울기, LSTM의 기억을 직접 계산해 본 기록」에서 AlexNet의 파라미터 수와 ResNet의 기울기, RNN과 LSTM의 기억을 계산해 봤습니다. 이번 글은 같은 책의 다음 범위입니다. 스터디는 K-DEVCON에서 모집한 읽기 모임이고, 저는 모임과 별도로 논문의 구조를 계산해 보고 작은 실험을 돌려 보고 있습니다. 지난 범위가 RNN과 LSTM이 무엇인지였다면 이번 범위의 첫 번째 질문은 큰 LSTM 언어 모델이 작은 학습 데이터에서 왜 쉽게 과적합하고, drop..