Text classification in a resource-constrained language using Deep Learning Techniques.
| dc.contributor.author | Hossain, Md. Rajib | |
| dc.date.accessioned | 2026-07-06T20:57:43Z | |
| dc.date.available | 2026-07-06T20:57:43Z | |
| dc.date.issued | 23-May-2024 | |
| dc.description | Thesis in CSE | |
| dc.description.abstract | The exponential growth of unstructured textual data on the World Wide Web, | |
| dc.description.abstract | particularly due to extensive online engagement and social media activities, poses | |
| dc.description.abstract | a significant challenge in classifying and organizing this data efficiently. Resourceconstrained | |
| dc.description.abstract | languages like Bengali face specific hurdles, including a lack of annotated | |
| dc.description.abstract | corpora, out-of-vocabulary word problems, inadequately tuned hyperparameters, | |
| dc.description.abstract | and class distribution imbalances. To address these issues, this research | |
| dc.description.abstract | introduces AFuNeT, i.e. Attention-based early fusion of transformer-based | |
| dc.description.abstract | language models. This intelligent text classification system encompasses three | |
| dc.description.abstract | crucial phases: corpora development, embedding model development, and text | |
| dc.description.abstract | classification model development, offering a comprehensive solution to enhance | |
| dc.description.abstract | text classification capabilities for such languages. | |
| dc.description.abstract | The first phase employs manual annotation and active learning techniques to | |
| dc.description.abstract | develop two main corpus types: embedding and text classification corpora. Five | |
| dc.description.abstract | specific embedding corpora are created for various tasks like Bengali document | |
| dc.description.abstract | classification, authorship attribution, and Covid text identification. Text classification | |
| dc.description.abstract | corpora are further divided into training and testing sets, comprising | |
| dc.description.abstract | seven specific corpora, i.e., Bengali Authorship Classification Corpus (BACC- | |
| dc.description.abstract | 18), Bengali Text Classification Corpus (BDTCC), Arabic Covid Text Classification | |
| dc.description.abstract | Corpus (AraCoV), Bengali Covid Text Classification Corpus (BCovC), English | |
| dc.description.abstract | Covid Text Classification Corpus (ECoVC), Bengali Text Classification Corpus | |
| dc.description.abstract | (BTCC11), and Bengali Multi-Modal Text Classification Corpus (BMMTC). | |
| dc.description.abstract | These corpora are essential for text classification and model performance evaluation. | |
| dc.description.abstract | In the second phase, we’ve developed non-contextual embedding models using | |
| dc.description.abstract | Bengali corpora and optimized their hyperparameters. These embeddings fall into | |
| dc.description.abstract | three categories: individual (GloVe, FastText, Word2Vec), meta (AVG-M, CATM, | |
| dc.description.abstract | CAT-SVD-M), and attention-based meta-embeddings (APeAGF, APeCGF). | |
| dc.description.abstract | Top-performing models from intrinsic evaluations are selected for downstream | |
| dc.description.abstract | tasks, with contextual embeddings like transformer-based models used for finetuning | |
| dc.description.abstract | and feature extraction. | |
| dc.identifier.other | http://103.99.128.19:8080/jspui/handle/123456789/483 | |
| dc.identifier.uri | http://103.99.128.19:8080/xmlui/handle/123456789/483 | |
| dc.publisher | CUET | |
| dc.source | CUET Digital Repository | |
| dc.subject | Corpora development, Data crawling, embedding model | |
| dc.title | Text classification in a resource-constrained language using Deep Learning Techniques. |
Files
Original bundle
1 - 1 of 1
