0% Complete
English
☰
صفحه اصلی
کنفرانسهای فعال
مدیریت منابع انسانی پایدار
حسابداری
بازاریابی و برندینگ در عصر هوش مصنوعی
هوش مصنوعی:نوآوری، کسبوکار و آموزش
ارشیو کنفرانسها
اولین کنفرانس ملی هوش مصنوعی
دومین کنفرانس ملی هوش مصنوعی
اولین کنگره ملی حسابداری، مالی و مالیاتی
32کنفرانس بین المللی زیست پزشکی
راهنمای شرکت
نحوه ثبتنام
ثبت نام مدیریت منابع انسانی پایدار
ثبت نام دومین کنگره ملی حسابداری
ثبت نام سومین کنفرانس ملی هوش مصنوعی
ثیت نام بازاریابی و برندینگ در عصر هوش مصنوعی
ثبت نام زنجیره ارزش نفت گاز و پتروشیمی
ارسال مقاله
فرمت مقالات مدیریت منابع انسانی پایدار
فرمت مقالات سیستم های هوشمند حسابداری
فرمت مقالات ملی بازاریابی و برندینگ در عصر هوش مصنوعی
فرمت مقالات سومین کنفرانس هوش مصنوعی
سوالات متداول
اخبار و رویدادها
درباره ما
تماس با ما
صفحه اصلی
/
دومین کنفرانس ملی عصر انفجار تکنولوژی؛ هوش مصنوعی، تحولی در صنعت، تجارت و زنجیره تامین و دومین کنفرانس ملی علم داده در کاربردهای مهندسی
Document Clustering Using Deep Pre-trained Language Model Embeddings for Information Retrieval
نویسندگان :
Mahdi Mohammadiha
1
Mohammad Hassan Sadreddini
2
Morteza Mohammadi Zanjireh
3
1- International University of Imam Khomeini
2- International University of Imam Khomeini
3- International University of Imam Khomeini
کلمات کلیدی :
Document Clustering،Information Retrieval،SBERT،UMAP،HDBSCAN
چکیده :
Document clustering is critical to information retrieval (IR) as it enhances user navigation, semantic organization, and exploration of large text collections. Current clustering techniques, though, are marred by poor accuracy and semantic inconsistency, with many misclassifying relevant documents as noise and using superficial textual representations. This study aims to develop a clustering pipeline that produces semantically meaningful and structurally coherent groups of documents to support more effective IR. We propose a method that combines SBERT embeddings for deep semantic representation, UMAP for structure-preserving dimensionality reduction, and HDBSCAN for flexible, density-based clustering without needing to predefine the number of clusters. Experimental evaluations on the 20 Newsgroups dataset reveal that our optimal setting with the paraphrase-mpnet-base-v2 model obtains a Silhouette Score of 0.6853, ARI of 0.7865, and NMI of 0.8186. These results illustrate the promise of embedding-based clustering methods to greatly improve the interpretability and effectiveness of IR systems on real-world text collections.
لیست مقالات
لیست مقالات بایگانی شده
تشخیص بیماری MS با استفاده از EfficientNet-B0 و CycleGAN بر پایه نقشههای ضخامت شبکیه
محبوبه سبزه یان - مریم سبزه یان - ماندانا سادات غفوریان - امین نوری
تاثیر تعدیل کننده شدت رقابت پذیری بازار محصولات و نبود تقارن در اطلاعات بر ارتباط مابین هزینه های سرمایه ای و ارزشگذاری شرکت
سینا سلیمانی - فاطمه صمدی
بررسی استقرار مدیریت دانش در شرکت آب و فاضلاب استان خراسان جنوبی
محدثه مشفقی - محسن صفاریان - محمد کاظمی - مهدی کیخای مقدم - نسیبه موحدفر
ساخت و مشخصه یابی چسب زیستالهام برپایه ژلاتین با اتصالات دوگانه آرژنین و اسید کافئیک برای هموستاز سریع
غزل یعقوبی - مهشید خرازیها
رابطه هوش مصنوعی مدیریت و سازمانها
حسین بوذری
تحلیلی جامع بر روندهای نوین بازاریابی محتوایی در فروشگاههای آنلاین در سالهای ۲۰۲۴ و ۲۰۲۵
سید رامان سیدی - آرش احمدی - مریم باباپیری
Stem cell engineering in tissue repair: A Review of Therapeutic Perspectives
Farnaz Mozayani - Mohammadbagher Kargar
بررسی ارتباط بین توانایی مدیریت و محدودیت مالی با تاکید بر نقش دانش مالی هیئت مدیره در شرکتهای دانش بنیان پذیرفته شده در بورس اوراق بهادار تهران
آروین نیک نام - قادر بابائی
ارتباط بین اطمینان بیش از حد مدیرعامل و خطر اخلاقی
عیسی ابیضی
Examination and Analysis of the Influence of Near-Infrared Light Absorption by Hair Melanin on fNIRS Signal
Elmira Baghaeifar - Sina Shamekhi
بیشتر
19 اردیبهشت 1405
راهنمای انتخاب کنفرانس معتبر برای چاپ مقاله علمی
19 اردیبهشت 1405
چرا شرکت در کنفرانسهای علمی برای مصاحبه دکتری اهمیت دارد؟
21 اردیبهشت 1405
پذیرش سریع مقاله در کنفرانسهای علمی مهندسی و فناوری آغاز شد
21 اردیبهشت 1405
آغاز ثبتنام در همایشهای بینالمللی مدیریت و حسابداری
ثمین همایش، سامانه مدیریت کنفرانس ها و جشنواره ها - نگارش 44.5.0