مقایسه مدل‌های مبتنی بر ترنسفورمر و شبکه‌های عصبی کانولوشنی برای بخش‌بندی دوبعدی و سه‌بعدی استخوان‌های لگن در تصاویر CT

وضعیت : تکمیل شده
اسکرین مقاله پنجم
_

توضیحات تکمیلی 

این مقاله به بخش‌بندی خودکار استخوان‌های لگن و قطعات شکستگی در تصاویر CT بیماران دچار شکستگی لگن با استفاده از یادگیری عمیق می‌پردازد. در این پژوهش، داده‌های 150 بیمار از مجموعه‌داده PENGWIN MICCAI 2024 استفاده شده و عملکرد معماری‌های U-Net، LinkNet و UNETR در حالت‌های دوبعدی و سه‌بعدی با یکدیگر مقایسه شده است. در مدل‌های CNN از backboneهای VGG19 و ResNet50 استفاده شده و UNETR نیز به‌عنوان معماری مبتنی بر Transformer بررسی شده است. مسئله بخش‌بندی شامل استخوان خاجی (Sacrum)، استخوان لگن چپ و استخوان لگن راست بوده و عملکرد مدل‌ها با معیارهایی مانند Dice، IoU، Accuracy، Sensitivity و Specificity ارزیابی شده است. نتایج نشان داد که U-Net دوبعدی با ResNet50 بهترین عملکرد را در بخش‌بندی دوبعدی با Dice=0.991 و IoU=0.982 به دست آورد، در حالی که در بخش‌بندی سه‌بعدی، 3D U-Net با VGG19 بهترین عملکرد را با Dice=0.9112 داشت. همچنین UNETR با وجود حساسیت پایین‌تر در شناسایی قطعات پیچیده شکستگی، Specificity بالای 0.993 و زمان استنتاج کمتر از یک دقیقه برای هر بیمار نشان داد. در مجموع، مطالعه نشان می‌دهد که مدل‌های CNN، به‌خصوص U-Net، می‌توانند دقت بسیار بالایی در بخش‌بندی استخوان‌های لگن داشته باشند و مدل‌های Transformer نیز از نظر درک زمینه کلی تصویر و کارایی محاسباتی ظرفیت مناسبی برای کاربردهای بالینی دارند.