형태소 분석·문장 분리·자모 처리·외래어 표기처럼 한국어에만 필요한 처리를 다루는 라이브러리. 영어권 도구로는 안 되는 영역이라 한국 개발자가 만들 수밖에 없고, 10년 가까이 유지되는 프로젝트도 있습니다.
“AI 기업들이 무료 한도를 째째하게 막는 게 킹받아서” — 상용 패키지 없이 파이토치 기본 연산만으로 Llama 3 규격(RMSNorm·SwiGLU·RoPE·KV-Cache)을 생코딩하고 노트북 GPU 24GB로 학습 중. 3,000스텝의 헛소리까지 공개
한국어 자연어처리 자료·도구·데이터셋을 모은 큐레이션 목록
트위터 한국어 분석기에서 이어진 오픈소스 한국어 텍스트 처리기
한국어 종단간(end-to-end) 음성인식 모델을 학습·평가하는 오픈소스 툴킷
카카오브레인이 공개한 한국어 생성 사전학습 모델
개인이 직접 학습시켜 공개한 한국어 ELECTRA 사전학습 모델
SKT가 공개한 한국어 BERT — 한국어 NLP의 오랜 기준선이었던 모델
네이버 영화 리뷰 20만 건에 긍·부정을 붙인 한국어 감성분석 표준 데이터셋