Text classification in a resource-constrained language using Deep Learning Techniques.

dc.contributor.authorHossain, Md. Rajib
dc.date.accessioned2026-07-06T20:57:43Z
dc.date.available2026-07-06T20:57:43Z
dc.date.issued23-May-2024
dc.descriptionThesis in CSE
dc.description.abstractThe exponential growth of unstructured textual data on the World Wide Web,
dc.description.abstractparticularly due to extensive online engagement and social media activities, poses
dc.description.abstracta significant challenge in classifying and organizing this data efficiently. Resourceconstrained
dc.description.abstractlanguages like Bengali face specific hurdles, including a lack of annotated
dc.description.abstractcorpora, out-of-vocabulary word problems, inadequately tuned hyperparameters,
dc.description.abstractand class distribution imbalances. To address these issues, this research
dc.description.abstractintroduces AFuNeT, i.e. Attention-based early fusion of transformer-based
dc.description.abstractlanguage models. This intelligent text classification system encompasses three
dc.description.abstractcrucial phases: corpora development, embedding model development, and text
dc.description.abstractclassification model development, offering a comprehensive solution to enhance
dc.description.abstracttext classification capabilities for such languages.
dc.description.abstractThe first phase employs manual annotation and active learning techniques to
dc.description.abstractdevelop two main corpus types: embedding and text classification corpora. Five
dc.description.abstractspecific embedding corpora are created for various tasks like Bengali document
dc.description.abstractclassification, authorship attribution, and Covid text identification. Text classification
dc.description.abstractcorpora are further divided into training and testing sets, comprising
dc.description.abstractseven specific corpora, i.e., Bengali Authorship Classification Corpus (BACC-
dc.description.abstract18), Bengali Text Classification Corpus (BDTCC), Arabic Covid Text Classification
dc.description.abstractCorpus (AraCoV), Bengali Covid Text Classification Corpus (BCovC), English
dc.description.abstractCovid Text Classification Corpus (ECoVC), Bengali Text Classification Corpus
dc.description.abstract(BTCC11), and Bengali Multi-Modal Text Classification Corpus (BMMTC).
dc.description.abstractThese corpora are essential for text classification and model performance evaluation.
dc.description.abstractIn the second phase, we’ve developed non-contextual embedding models using
dc.description.abstractBengali corpora and optimized their hyperparameters. These embeddings fall into
dc.description.abstractthree categories: individual (GloVe, FastText, Word2Vec), meta (AVG-M, CATM,
dc.description.abstractCAT-SVD-M), and attention-based meta-embeddings (APeAGF, APeCGF).
dc.description.abstractTop-performing models from intrinsic evaluations are selected for downstream
dc.description.abstracttasks, with contextual embeddings like transformer-based models used for finetuning
dc.description.abstractand feature extraction.
dc.identifier.otherhttp://103.99.128.19:8080/jspui/handle/123456789/483
dc.identifier.urihttp://103.99.128.19:8080/xmlui/handle/123456789/483
dc.publisherCUET
dc.sourceCUET Digital Repository
dc.subjectCorpora development, Data crawling, embedding model
dc.titleText classification in a resource-constrained language using Deep Learning Techniques.

Files

Original bundle

Now showing 1 - 1 of 1
Thumbnail Image
Name:
PhD_Thesis_for_printing-5.pdf
Size:
37.07 MB
Format:
Adobe Portable Document Format

Collections