• شماره مدرك
    21199
  • شماره راهنما
    18165
  • پديد آورنده

    كمالي، اميرحسين

  • عنوان

    بخش‌بندي تصاوير دهانه حنجره با استفاده از يادگيري عميق

  • مقطع تحصيلي
    كارشناسي ارشد
  • گرايش تحصيلي
    هوش مصنوعي و رباتيكز
  • محل تحصيل
    اصفهان : دانشگاه صنعتي اصفهان
  • سال دفاع
    1405
  • صفحه شمار
    چهارده،83ص : مصور،جدول،نمودار
  • توصيفگر ها

    دهانه حنجره , بخش‌بندي تصاوير پزشكي , بينايي كامپيوتر , يادگيري عميق

  • تاريخ ورود اطلاعات
    1405/05/22
  • كتابنامه
    كتابنامه
  • رشته تحصيلي
    مهندسي كامپيوتر
  • دانشكده
    مهندسي برق و كامپيوتر
  • تاريخ ويرايش اطلاعات
    1405/05/26
  • كد ايرانداك
    23194998
  • چكيده فارسي
    بخش‌بندي دقيق ناحيه دهانه حنجره در تصاوير ويدئوآندوسكوپي پرسرعت، گامي بنيادين در تحليل كمي عملكرد تارهاي صوتي و تشخيص آسيب‌شناسي‌هاي حنجره محسوب مي‌شود. با وجود پيشرفت‌هاي اخير، چالش‌هايي نظير تنوع بالاي تجهيزات تصويربرداري، تغييرات شديد نورپردازي و وجود اغتشاشات تصويري در مجموعه داده‌هايي نظير مجموعه‌داده BAGLS، دستيابي به دقت و پايداري بالا را دشوار ساخته است. در اين پايان‌نامه، رويكردهاي نويني مبتني بر يادگيري عميق جهت بهبود بخش‌بندي خودكار دهانه حنجره ارائه شده است. در گام نخست، با تمركز بر ارتقاي كيفيت داده ورودي، يك روش پيش‌پردازش جهت حذف حاشيه‌هاي سياه زائد و يك راهبرد افزايش داده هدفمند مبتني بر تحليل حساسيت دوربين‌ها طراحي شد. هم‌زمان، اصلاح معماري شبكه SA-UNet و بهره‌گيري از الگوريتم بهينه‌سازي مناسب، منجر به بهبود استخراج ويژگي‌هاي ساختاري شد. در گام دوم، به منظور بهره‌گيري از نقاط قوت معماري‌هاي مختلف، يك چارچوب يادگيري گروهي انتخابي پيشنهاد شده است. در اين روش، يك شبكه دسته‌بند هوشمند طراحي گرديده كه با دريافت تصوير و برخي مؤلفه‌هاي نوآورانه، به صورت پويا تشخيص مي‌دهد كه براي هر تصوير ورودي، كدام‌يك از مدل‌هاي پايه عملكرد دقيق‌تري ارائه مي‌دهد. در گام سوم، به منظور كاهش مثبت‌هاي كاذب در پس‌زمينه، بهبود مكان‌يابي مدل و تمركز دقيق‌تر بر ناحيه هدف، يك روش دومرحله‌اي بخش‌بندي هدايت‌شده پيشنهاد شده است. در اين روش ابتدا از يك شبكه تشخيص شيء (مانند YOLOv5) براي يافتن كادر محدودكننده دهانه حنجره استفاده مي‌شود. سپس، يك معماري جديد با نام BBox-UNet طراحي شده است كه اطلاعات كادر محدودكننده را به عنوان ورودي كمكي با تزريق به لايه‌هاي رمزگشا دريافت كرده و فرآيند بخش‌بندي را به انجام مي‌رساند. در نهايت، با استفاده از روش‌هاي خرد جمعي مدل‌ها و رأي‌گيري، خروجي‌هاي حاصل تركيب شده‌اند. نتايج ارزيابي‌ها نشان مي‌دهد كه روش‌هاي پيشنهادي توانسته‌اند با غلبه بر چالش‌هاي ناهمگوني داده‌ها، دقت بخش‌بندي را به طور معناداري ارتقا دهند و به امتياز اشتراك بر اجتماع (IoU) 87/02 درصد و ضريب تشابه دايس (DSC) برابر با 93/06 درصد دست يابند. اين دستاورد نشان‌دهنده برتري روش پيشنهادي نسبت به روش‌هاي پيشين بوده و قابليت اطمينان آن را براي كاربردهاي باليني و كمك‌تشخيصي تأييد مي‌كند.
  • چكيده انگليسي
    Accurate segmentation of the glottal opening in high-speed videoendoscopy is a fundamental step for quantitative analysis of vocal-fold function an‎d for detecting laryngeal pathologies. Despite recent advances, high heterogeneity across imaging devices, severe illumination variations, an‎d image artifacts in multi-center datasets (e.g., the BAGLS dataset) still make it difficult to obtain both high accuracy an‎d robust performance. In this thesis, we propose several novel deep-learning-based approaches to improve automatic glottis segmentation. First, focusing on input data quality, we introduce a preprocessing method for removing extraneous black borders an‎d a targeted data-augmentation strategy driven by camera-sensitivity analysis. Concurrently, we refine the SA-UNet architecture an‎d selec‎t an appropriate optimization algorithm to enhance extraction of structural features. Second, to exploit the complementary strengths of different architectures, we propose a selec‎tive ensemble learning framework. This framework includes a learned selec‎tor network that, given an input image an‎d several novel auxiliary features, dynamically determines which base model is expected to perform best for that particular image. Third, to reduce false positives in the background, improve model localization, an‎d focus segmentation more precisely on the target region, we develop a two-stage, guided segmentation approach. In this method, an object-detection network (e.g., YOLOv5) is first used to locate a bounding box around the glottal opening. We then introduce a new architecture named BBox-UNet, which accepts the bounding-box information as an auxiliary input by injecting it into the decoder layers an‎d performs the segmentation. Finally, outputs are combined using ensemble methods an‎d a voting scheme. eva‎luation results show that the proposed methods effectively overcome data heterogeneity an‎d significantly improve segmentation accuracy, achieving an Intersection over unio‎n (IoU) of 87.02% an‎d a Dice similarity coefficient (DSC) of 93.06%. These results demonstrate the superiority of the proposed approach over prior methods an‎d indicate its reliability for clinical an‎d decision-support applications.
  • استاد راهنما
    نادر كريمي
  • استاد مشاور
    شادرخ سماوي
  • استاد داور
    مينا اميري , فرزانه شايق بروجني