文本分类数据集是一种专门用于训练机器学习模型以识别和分类文本内容的数据集合。
这种数据集通常包含了大量的文本样本,每个样本都被标记或关联了一个或多个类别标签。文本分类数据集可以帮助模型学会根据文本的内容将其归入预定义的类别中。
원곡 말뭉치. 자연어 생성·문화유산 연구에 최적.
송사 말뭉치. GPT 계열 모델을 활용한 언어 모델링·텍스트 생성에 최적.
중국 고전 칠언율시. 텍스트 분류·시 생성 등 자연어 처리에 최적.