KoBERT
SKT가 공개한 한국어 BERT — 한국어 NLP의 오랜 기준선이었던 모델
SKTBrain/KoBERT
- 마지막 push 2025-06-14
왜 중요했나:
BERT가 나왔을 때 영어 모델을 한국어에 그대로 쓰면 성능이 크게 떨어졌습니다. 토크나이저가 한글을 잘게 부수고, 학습 데이터에 한국어가 거의 없었기 때문입니다.
대기업이 한국어로 다시 학습시켜 공개하자 개인과 소규모 팀도 그 위에서 파인튜닝할 수 있게 됐습니다. 한국어 NLP 논문·프로젝트가 오랫동안 이 모델을 기준선으로 삼았습니다.
정직하게 볼 지점:
지금 새로 시작한다면 권하기 어렵습니다. 한국어를 잘 다루는 최신 모델이 여럿 나왔고, 문장 임베딩·분류 어느 쪽이든 더 나은 선택지가 있습니다.
그리고 설치가 까다롭기로 알려져 있습니다 — 의존성 버전이 고정돼 있어 최신 파이썬·PyTorch 조합에서 막히는 일이 흔합니다. 역사적 기준선과 학습용으로 보는 편이 맞습니다.
함께 볼 한국어 사전학습 모델·도구 (우리 디스커버 등록 6편 중 나머지 5):
- KoELECTRA (★638) — 개인이 학습시켜 공개한 한국어 ELECTRA
- KoGPT (★1,010) — 카카오브레인의 한국어 생성 모델
- kospeech (★637) — 한국어 종단간 음성인식 툴킷
- open-korean-text (★669) — 트위터 형태소 분석기의 후신
- KoAlpaca (★1,572) — 한국어 명령어 이해 모델 (2024-10 정체)
여섯 편 모두 갱신이 멈췄습니다. 2019~2024년에 나와 각자 한 시기의 기준선이었고, 지금은 더 좋은 모델이 있습니다. 그럼에도 남겨두는 이유는 한국어 NLP가 어디서 시작해 어디로 갔는지를 보여주기 때문입니다.
KoBERT는 이 중 가장 널리 인용된 기준선입니다. 성능이 최고여서가 아니라 먼저 나와서 모두가 비교 대상으로 삼았기 때문입니다. 기준선의 값은 정확도가 아니라 공통성에 있습니다.
타겟 사용자:
- 한국어 NLP 논문의 비교 대상을 이해하려는 연구자