وبلاگ
پاکسازی دادهها (Data Cleansing) پیش از پیادهسازی الگوریتمهای یادگیری ماشین
- 21 سپتامبر, 2026
- ارسال شده توسط: تیم سئو
- دسته بندی: مدیریت داده مقالات تخصصی

کیفیت داده یکی از تعیینکنندهترین عوامل موفقیت پروژههای یادگیری ماشین است. این مقاله با تکیه بر پژوهشهای سال ۲۰۲۶ و چند مرجع بنیادین، چهار محور را بررسی میکند: دستهبندی وظایف پاکسازی، نشت داده (Data Leakage) در پیشپردازش، شناسایی برچسبهای نادرست، و نقش مدلهای زبانی بزرگ (LLM) در خودکارسازی. نتیجه اصلی این است که پاکسازی مرحلهای مقدماتی و جدا از مدلسازی نیست. این فرایند بخشی از روششناسی ارزیابی مدل است و باید مثل خود مدل با دقت طراحی و اعتبارسنجی شود.
پاکسازی داده نخستین مرحله هر پروژه یادگیری ماشین و از حیاتیترین فرایندهای تحلیل داده است. علت روشن است: دادههای دنیای واقعی بهندرت تمیزند، زیرا ورود دستی داده یا نقص فرایندهای خودکار جمعآوری نویز ایجاد میکند. خرابی حسگرها و خطای انسانی نیز ناسازگاری و ناقصبودن داده را بهدنبال دارد. مدلی که روی چنین دادهای آموزش ببیند، خطاها را هم میآموزد و همراه با الگوهای درست به کار میگیرد.
مرور نظاممند مبتنی بر ۱۰۱ مقاله (۲۰۱۶ تا ۲۰۲۲) فعالیتهای پاکسازی را در شش دسته تفکیک میکند: پاکسازی ویژگیها، پاکسازی برچسبها، تطبیق موجودیتها، تشخیص دادههای پرت، جایگذاری مقادیر گمشده و پاکسازی جامع. این دستهبندی چارچوب مناسبی برای بخشهای بعدی است.
وظایف اصلی پاکسازی
مقادیر گمشده. پیش از انتخاب روش جایگذاری (میانگین، میانه، KNN یا مدلمحور)، باید سازوکار گمشدگی را بررسی کرد. گمشدگی کاملاً تصادفی با گمشدگی وابسته به خود متغیر یا به متغیرهای دیگر پیامدهای متفاوتی دارد و جایگذاری نابجا میتواند سوگیری ایجاد کند.
رکوردهای تکراری و ناسازگار. تکرار رکوردها باعث میشود نمونهای مشابه هم در آموزش و هم در آزمون ظاهر شود و دقت واقعی بیشبرآورد شود. یکسانسازی قالبها (تاریخ، واحد، رمزگذاری متن) نیز پیششرط هر تحلیل معتبر است.
دادههای پرت. هر مقدار پرت خطا نیست. ممکن است پدیدهای نادر اما واقعی باشد، مثل تقلب مالی یا خرابی تجهیزات. حذف کورکورانه آنها میتواند دقیقاً همان الگویی را حذف کند که مدل باید بیاموزد.
نکتهای که ادبیات دادهمحور (Data-Centric AI) یادآوری میکند این است که اصلاح کامل داده لزوماً بالاترین دقت مدل را تضمین نمیکند. بنابراین هدف باید بهبود سنجیده و مبتنی بر ارزیابی باشد، نه «تمیزکردن مطلق».
نشت داده در مرحله پیشپردازش
پرخطاترین اشتباه در این حوزه، اجرای پاکسازی و تبدیلها پیش از تقسیم داده به آموزش و آزمون است. مقاله bioLeak (آوریل ۲۰۲۶) این پدیده را «نشت پیشپردازش» مینامد و توضیح میدهد که این نشت زمانی رخ میدهد که کمیتهای مورد استفاده برای تبدیل پیشبینها با اطلاعاتی بیرون از فولد آموزش برآورد شوند. جایگذاری مقادیر گمشده، نرمالسازی، فیلتر ویژگیها و انتخاب ویژگی نمونههای رایج آناند. همان مقاله یادآور میشود که در خط لولههای زیستپزشکی، نرمالسازی و فیلتر پیشبینها اغلب مراحل مقدماتی پاکسازی تلقی میشوند و نه جزئی از رویه مدلسازی.
آنچه این خطا را خطرناک میکند پنهانبودن آن است. یادداشت آماری منتشرشده در ژانویه ۲۰۲۶ اشاره میکند که این نوع نشت اغلب معیارهایی پایدار و چشمگیر تولید میکند و همین، اطمینان کاذب بهوجود میآورد. در دادههای سری زمانی نیز نشت زمانی رخ میدهد و محاسباتی مثل میانگین متحرک یا نرمالسازی با استفاده از مشاهدات آینده آن را ایجاد میکند.
راهکارهای پیشنهادی در منابع ۲۰۲۶ روشناند. در دادههایی که چند ردیف به یک موجودیت تعلق دارند (مثلاً چند تصویر از یک بیمار)، باید از GroupKFold استفاده کرد تا همه دادههای یک موجودیت در یک بخش بمانند. برای پیشگیری از نشت درون فولدها نیز باید از Pipeline بهره برد و SMOTE یا نمونهافزایی را پس از تقسیم اعمال کرد. پژوهشی درباره تشخیص عیب یاتاقان نیز همین اصل را بیان میکند: همه مراحل پیشپردازش و مهندسی ویژگی باید تنها روی داده آموزش برازش شوند، و افزایش داده پیش از تقسیم باعث نفوذ اطلاعات آزمون به آموزش میشود.
برچسبهای نادرست
در یادگیری نظارتشده، خطای برچسب به اندازه خطای ویژگیها آسیبزاست. شبکههای عصبی بیشپارامتری بهسادگی برچسبهای آلوده را حفظ میکنند و این امر دقت و تعمیمپذیری را کاهش میدهد. در سنجش از دور، خطاهای حاشیهنویسی میتوانند عملکرد و پایداری مدلهای قطعهبندی مدرن را بهطور محسوس تضعیف کنند. همین انگیزه پژوهشگران را به ساخت معیارهای سنجش برای تخمین و رتبهبندی نمونهها بر اساس میزان نویز برچسب واداشته است.
سه یافته اخیر قابل توجهاند:
- چارچوب تطبیقی (ژوئن ۲۰۲۶). روشهای موجود اغلب به آستانههای دستی یا دانستن نرخ نویز وابستهاند. این کار چارچوبی خودتطبیق پیشنهاد میکند که سرنخهای محلی، سراسری و پویایی یادگیری را برای تشخیص برچسب نادرست ترکیب میکند.
- معیار CILN (ژوئن ۲۰۲۶). دشواری یک معیار سنجش نهفقط به مقدار نویز برچسب، بلکه به ساختار آن نیز بستگی دارد. ارزیابی روشها باید انواع نویز را پوشش دهد.
- بنچمارک تشخیص نویز (اواخر ۲۰۲۵). در این مطالعه که روی دادههای تصویری و جدولی انجام شد، جمعآوری اطلاعات دروننمونهای همراه با میانگینگیری احتمال و حاشیه لوجیت (logit margin) در بیشتر سناریوها بهترین نتیجه را داد.
مدلهای زبانی بزرگ و پاکسازی خودکار
پاکسازی سنتی از طریق کد، بازبینی دستی یا قواعد انجام میشود، اما گاهی مجموعهداده آنقدر بزرگ، آشفته و ظریف است که این روشها کارایی ندارند. مطالعه موردی منتشرشده در مارس ۲۰۲۶ در نشریه The Actuary نشان میدهد LLMها در چنین موقعیتهایی میتوانند زمان پاکسازی را کاهش دهند.
با این حال، شواهد علمی هشدار میدهند که باید با احتیاط پیش رفت. پژوهش «When Helping Hurts» (ژوئن ۲۰۲۶) روی سه بنچمارک و چهار خانواده مدل نشان میدهد مناظره چندعاملی اثر دوگانه دارد: کیفیت تولید (اصلاح داده) را در هر چهار مدل کاهش میدهد، اما F1 تشخیص خطا را حدود ۲۷ نقطه درصد بهبود میبخشد. علت کاهش نیز بازخوردهای توهمی منتقد است که تولیدکننده بدون بررسی میپذیرد. نویسندگان نشان میدهند که تنها ترکیب منتقد مستقل با اتکا به اجرای کد و تولید مبتنی بر شواهد، از تکعامل بهتر عمل میکند. این پژوهش هنوز در مرحله پیشچاپ است و ارزیابی مستقل آن نشان داده ادعای تعمیمپذیریاش نیاز به بررسی بیشتر دارد. با وجود این، پیام عملی آن روشن است: LLM را برای کشف خطا بهکار بگیرید و برای ترمیم خودکار، بدون اعتبارسنجی مبتنی بر اجرای کد، به آن اعتماد نکنید.
چارچوب عملی پیشنهادی
بر پایه یافتههای بالا، ترتیب زیر برای پروژههای جدید توصیه میشود:
- پروفایلسازی اولیه برای شناخت الگوی گمشدگی، توزیعها، تکرارها و ناسازگاریها، بدون هیچ اصلاحی.
- تقسیم داده (تصادفی، طبقهای، گروهی یا زمانی، بسته به ماهیت داده) پیش از هر تبدیل آماری.
- قراردادن همه مراحل برازشپذیر (جایگذاری، مقیاسدهی، رمزگذاری، انتخاب ویژگی) درون Pipeline و برازش آنها فقط روی داده آموزش.
- بازبینی برچسبها با روشهای تشخیص نویز و بازبینی انسانی نمونههای مشکوک، بهویژه در مسائل پرمخاطره.
- مستندسازی و نسخهبندی همه تغییرات برای بازتولیدپذیری.
- مقایسه مدل روی داده پاکسازیشده و خام تا اثر واقعی پاکسازی سنجیده شود.
جمعبندی
پژوهشهای ۲۰۲۶ بر سه نکته تأکید دارند. اول، پاکسازی بخشی از طراحی آزمایش است و اجرای آن پیش از تقسیم داده، نتایج را بدون هشدار مخدوش میکند. دوم، برچسبهای نادرست مسئلهای مستقل و جدیاند و روشهای تشخیص آنها به سمت رویکردهای تطبیقی و ارزیابی ساختارمند پیش میروند. سوم، LLMها ابزاری امیدبخش اما نیازمند نظارتاند و در تشخیص خطا مؤثرتر از ترمیم خودکار عمل میکنند.