언어 모델은 인공지능의 한 갈래로, 자연어-처리에서 문장의 흐름을 예측하고 생성하도록 만든 모델이다.[1][3][4] 오늘날 널리 쓰이는 생성형-인공지능 서비스와 대규모 언어 모델은 대부분 트랜스포머와 신경망을 바탕으로 발전해 왔다.[1][2][3]
이 문서는 언어 모델의 기본 구조, 학습 과정, 활용 영역, 한계와 운영상의 주의점을 함께 정리한다.[3][4][5] 개념을 따라가다 보면 기계-학습, 학습-데이터, 평가-모델 같은 주변 문서와도 자연스럽게 연결된다.
1. 개요
2. 구조와 학습
3. 활용
4. 한계와 위험
5. 평가와 운영
6. 같이 보기
8. 인용 및 각주
[1] Attention Is All You Need, arxiv.org(새 탭에서 열림)
[2] BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding, arxiv.org(새 탭에서 열림)
[3] What are Large Language Models? | NVIDIA Glossary, www.nvidia.com(새 탭에서 열림)
[4] What Are Large Language Models (LLMs)? - IBM, www.ibm.com(새 탭에서 열림)
[5] Language Models are Few-Shot Learners, arxiv.org(새 탭에서 열림)