یادگیری نظارت‌شده چیست؟
هوش مصنوعی و یادگیری ماشین

یادگیری نظارت شده چیست؟ از مفهوم و انواع تا الگوریتم‌ها و کاربردها

یادگیری نظارت شده

یادگیری نظارت شده چیست؟ از مفهوم و انواع تا الگوریتم‌ها و کاربردها

یادگیری نظارت شده چیست؟

یادگیری ماشین یکی از مهم‌ترین شاخه‌های هوش مصنوعی است که به سیستم‌ها اجازه می‌دهد بدون برنامه‌نویسی مستقیم برای تک‌تک تصمیم‌ها، از داده‌ها الگو یاد بگیرند. در میان روش‌های مختلف یادگیری ماشین، یادگیری نظارت شده (Supervised Learning) پرکاربردترین و پایه‌ای‌ترین روش است.

بسیاری از مسائل واقعی مانند تشخیص ایمیل‌های اسپم، پیش‌بینی قیمت خانه، تشخیص بیماری، اعتبارسنجی مشتریان و پیش‌بینی فروش با استفاده از این روش حل می‌شوند.

اما یادگیری نظارت شده دقیقاً چیست؟ چگونه کار می‌کند؟ چه تفاوتی با یادگیری بدون نظارت دارد؟ چه الگوریتم‌هایی در آن استفاده می‌شوند و چه زمانی باید از آن استفاده کنیم؟

در این راهنما از رهیارا، این مفاهیم را مرحله‌به‌مرحله بررسی می‌کنیم.


در این مقاله چه چیزهایی یاد می‌گیرید؟

  • یادگیری نظارت شده دقیقاً چیست و چگونه کار می‌کند؟

  • تفاوت Classification و Regression در یادگیری نظارت شده

  • مهم‌ترین الگوریتم‌های Supervised Learning را بشناسید

  • تفاوت یادگیری نظارت شده با بدون نظارت و تقویتی

یادگیری نظارت شده چیست؟

یادگیری نظارت شده (Supervised Learning) یکی از روش‌های اصلی یادگیری ماشین است که در آن مدل با استفاده از داده‌های دارای برچسب (Labeled Data) آموزش داده می‌شود.

به زبان ساده، در یادگیری نظارت شده، علاوه بر اطلاعات ورودی، پاسخ صحیح یا همان خروجی مورد انتظار نیز در اختیار مدل قرار می‌گیرد.

مدل با مشاهده‌ی نمونه‌های مختلف تلاش می‌کند رابطه‌ای میان ورودی‌ها و خروجی‌های صحیح پیدا کند و سپس از این رابطه برای پیش‌بینی نمونه‌های جدید استفاده کند.

برای مثال، فرض کنید می‌خواهیم مدلی بسازیم که قیمت خانه را پیش‌بینی کند. برای آموزش مدل، اطلاعاتی مانند متراژ خانه، تعداد اتاق‌ها، سن ساختمان، موقعیت مکانی و تعداد پارکینگ را در اختیار آن قرار می‌دهیم. در کنار این اطلاعات، قیمت واقعی خانه نیز مشخص است.

مدل با بررسی تعداد زیادی خانه یاد می‌گیرد که چگونه ویژگی‌های خانه با قیمت آن ارتباط دارند. سپس اگر اطلاعات یک خانه‌ی جدید را به مدل بدهیم، مدل می‌تواند قیمت آن را پیش‌بینی کند.

به‌صورت ساده:

ورودی‌ها ← مدل یادگیری ماشین ← خروجی پیش‌بینی‌شده

بنابراین مهم‌ترین ویژگی یادگیری نظارت شده این است که در زمان آموزش، پاسخ صحیح نمونه‌های آموزشی را در اختیار داریم.

یادگیری نظارت شده چگونه کار می‌کند؟

فرآیند یادگیری نظارت شده را می‌توان در چند مرحله خلاصه کرد.

مرحله ۱: جمع‌آوری داده

ابتدا داده‌های مربوط به مسئله موردنظر جمع‌آوری می‌شوند. برای مثال، اگر هدف پیش‌بینی قیمت خانه باشد، می‌توان اطلاعات هزاران خانه را جمع‌آوری کرد.

مرحله ۲: مشخص کردن ویژگی‌ها و برچسب

داده‌ها معمولاً از دو بخش اصلی تشکیل می‌شوند:

  • ویژگی‌ها (Features): اطلاعاتی که مدل از آن‌ها برای پیش‌بینی استفاده می‌کند.
  • برچسب (Label/Target): پاسخ صحیحی که می‌خواهیم مدل آن را پیش‌بینی کند.

مثلاً:

متراژ تعداد اتاق سن ساختمان قیمت
80 2 10 4 میلیارد
120 3 5 7 میلیارد
150 3 2 9 میلیارد

در اینجا متراژ، تعداد اتاق و سن ساختمان Features و قیمت Target است.

مرحله ۳: آموزش مدل

داده‌های آموزشی در اختیار الگوریتم قرار می‌گیرند. مدل تلاش می‌کند رابطه‌ای بین ویژگی‌های ورودی و خروجی واقعی پیدا کند.

مرحله ۴: ارزیابی مدل

پس از آموزش، مدل روی داده‌هایی که در فرآیند آموزش استفاده نشده‌اند آزمایش می‌شود. هدف این است که ببینیم مدل تا چه اندازه می‌تواند روی داده‌های جدید عملکرد مناسبی داشته باشد.

مرحله ۵: پیش‌بینی داده‌های جدید

در نهایت، مدل می‌تواند برای نمونه‌هایی که پاسخ آن‌ها را نمی‌دانیم، خروجی پیش‌بینی کند.

فرایند یادگیری نظارت شده (Supervised Learning) از داده‌های برچسب‌دار تا پیش‌بینی خروجی
شکل ۱ فرایند یادگیری نظارت شده (Supervised Learning) از داده‌های برچسب‌دار تا پیش‌بینی خروجی

داده برچسب‌دار چیست؟

مفهوم برچسب یا Label یکی از مهم‌ترین مفاهیم در یادگیری نظارت شده است. فرض کنید مجموعه‌ای از ایمیل‌ها داریم و می‌خواهیم مشخص کنیم هر ایمیل اسپم است یا غیراسپم.

در این حالت:

  • متن ایمیل و ویژگی‌های آن ← ورودی
  • اسپم یا غیراسپم ← برچسب

مثلاً:

متن ایمیل برچسب
برنده جایزه شدید Spam
جلسه فردا ساعت ۱۰ برگزار می‌شود Not Spam
برای دریافت جایزه کلیک کنید Spam

مدل با مشاهده‌ی این نمونه‌های برچسب‌دار، الگوهای مرتبط با هر کلاس را یاد می‌گیرد. پس اگر یک ایمیل جدید وارد شود، مدل می‌تواند احتمال اسپم بودن آن را پیش‌بینی کند.

اجزای اصلی یادگیری نظارت شده

یک مسئله یادگیری نظارت شده معمولاً شامل اجزای زیر است:

  • داده‌های ورودی: اطلاعاتی که مدل بر اساس آن‌ها تصمیم‌گیری می‌کند.
  • ویژگی‌ها: متغیرهایی که نماینده خصوصیات هر نمونه هستند.
  • برچسب یا Target: مقداری که مدل باید یاد بگیرد آن را پیش‌بینی کند.
  • الگوریتم یادگیری: روشی که برای پیدا کردن رابطه میان ورودی و خروجی استفاده می‌شود.
  • تابع خطا: اختلاف میان مقدار واقعی و مقدار پیش‌بینی‌شده را اندازه‌گیری می‌کند.
  • مدل آموزش‌دیده: مدلی که پس از یادگیری الگوهای موجود در داده آماده پیش‌بینی نمونه‌های جدید است.

انواع مسائل در یادگیری نظارت شده

مسائل یادگیری نظارت شده را می‌توان به دو گروه اصلی تقسیم کرد:

  • Classification یا طبقه‌بندی
  • Regression یا رگرسیون

طبقه‌بندی یا Classification چیست؟

در Classification هدف این است که مدل یک نمونه را در یکی از کلاس‌های مشخص قرار دهد. مثال‌ها: تشخیص اسپم یا غیر اسپم، تشخیص بیمار یا سالم، تشخیص تقلبی یا واقعی بودن تراکنش، تشخیص نوع گل، تشخیص احساس مثبت یا منفی در متن.

در این مسائل خروجی معمولاً یک کلاس یا دسته است.

طبقه‌بندی دودویی: اگر فقط دو کلاس داشته باشیم، مسئله Binary Classification نام دارد. مثلاً بیمار/سالم یا اسپم/غیر اسپم.

طبقه‌بندی چندکلاسه: اگر بیش از دو کلاس داشته باشیم، مسئله Multiclass Classification است. مثلاً تشخیص نوع حیوان: گربه، سگ، اسب، پرنده.

طبقه‌بندی چندبرچسبی: در Multilabel Classification یک نمونه می‌تواند هم‌زمان چند برچسب داشته باشد. برای مثال، یک تصویر ممکن است هم‌زمان شامل سگ + خودرو + انسان باشد.

رگرسیون یا Regression چیست؟

در رگرسیون، هدف پیش‌بینی یک مقدار عددی است. مثال‌ها: پیش‌بینی قیمت خانه، پیش‌بینی فروش ماه آینده، پیش‌بینی دمای هوا، پیش‌بینی مدت زمان یک فرآیند، پیش‌بینی میزان مصرف انرژی.

بنابراین یک تفاوت ساده میان این دو نوع مسئله:

نوع مسئله نوع خروجی مثال
Classification کلاس یا دسته اسپم / غیر اسپم
Regression مقدار عددی قیمت خانه

مقایسه Classification و Regression در یادگیری نظارت شده
شکل ۲ مقایسه Classification و Regression در یادگیری نظارت شده

مهم‌ترین الگوریتم‌های یادگیری نظارت شده

الگوریتم‌های متعددی برای حل مسائل یادگیری نظارت شده وجود دارند. مهم‌ترین آن‌ها عبارت‌اند از:

رگرسیون خطی (Linear Regression)

یکی از ساده‌ترین الگوریتم‌ها برای مسائل رگرسیون است. این الگوریتم تلاش می‌کند رابطه‌ای میان متغیرهای ورودی و یک خروجی عددی پیدا کند.

رگرسیون لجستیک (Logistic Regression)

با وجود نام آن، یکی از الگوریتم‌های رایج Classification است و به‌خصوص در مسائل طبقه‌بندی دودویی کاربرد زیادی دارد.

درخت تصمیم (Decision Tree)

مدل با ایجاد مجموعه‌ای از تصمیم‌ها یا شرط‌ها، داده‌ها را به گروه‌های مختلف تقسیم می‌کند. مزیت مهم درخت تصمیم این است که منطق تصمیم‌گیری آن نسبتاً قابل تفسیر است.

جنگل تصادفی (Random Forest)

Random Forest مجموعه‌ای از چندین درخت تصمیم است که با ترکیب خروجی آن‌ها، پیش‌بینی نهایی را انجام می‌دهد. این روش معمولاً نسبت به یک درخت تصمیم منفرد پایداری و قدرت تعمیم بیشتری دارد.

ماشین بردار پشتیبان (SVM)

Support Vector Machine تلاش می‌کند مرزی مناسب برای جداسازی کلاس‌ها پیدا کند و در مسائل مختلف طبقه‌بندی کاربرد دارد.

K-Nearest Neighbors

در روش KNN، مدل برای پیش‌بینی یک نمونه جدید به نمونه‌های نزدیک به آن در داده‌های آموزشی توجه می‌کند.

شبکه‌های عصبی مصنوعی

شبکه‌های عصبی با استفاده از لایه‌ها و نورون‌های متعدد می‌توانند روابط پیچیده میان ورودی و خروجی را یاد بگیرند. این روش‌ها به‌ویژه در مسائل پیچیده مانند پردازش تصویر، صوت و زبان کاربرد گسترده‌ای دارند.

الگوریتم‌های Boosting

روش‌هایی مانند XGBoost، LightGBM و CatBoost با ترکیب مدل‌های ضعیف‌تر، یک مدل قدرتمند ایجاد می‌کنند و در بسیاری از مسائل داده‌محور عملکرد بسیار خوبی دارند.

یک مثال ساده از یادگیری نظارت شده

فرض کنید یک فروشگاه اینترنتی می‌خواهد احتمال خرید یک محصول توسط مشتری را پیش‌بینی کند. برای هر مشتری اطلاعاتی مانند سن، تعداد خریدهای قبلی، مبلغ خریدهای قبلی، تعداد دفعات ورود به سایت و مدت زمان حضور در سایت در اختیار داریم. همچنین می‌دانیم که هر مشتری در نهایت محصول را خریده یا نخریده است.

بنابراین:

  • Features = اطلاعات مشتری
  • Label = خرید / عدم خرید

مدل با استفاده از مشتریان قبلی آموزش می‌بیند و سپس می‌تواند برای یک مشتری جدید احتمال خرید را پیش‌بینی کند. این دقیقاً یک مسئله یادگیری نظارت شده است.

تفاوت یادگیری نظارت شده و بدون نظارت

یکی از مهم‌ترین تفاوت‌ها در یادگیری ماشین، تفاوت میان Supervised Learning و Unsupervised Learning است. در یادگیری نظارت شده، داده‌ها دارای برچسب هستند. اما در یادگیری بدون نظارت، مدل با داده‌هایی مواجه می‌شود که پاسخ صحیح یا برچسب مشخصی برای آن‌ها وجود ندارد.

برای مثال، اگر اطلاعات مشتریان یک فروشگاه را داشته باشیم: در یادگیری نظارت شده ممکن است بخواهیم پیش‌بینی کنیم کدام مشتری خرید خواهد کرد. اما در یادگیری بدون نظارت ممکن است بخواهیم مشتریان را بر اساس رفتارشان گروه‌بندی کنیم.

به‌صورت خلاصه:

ویژگی یادگیری نظارت شده یادگیری بدون نظارت
برچسب دارد ندارد
هدف پیش‌بینی خروجی کشف الگو
نمونه مسئله تشخیص بیماری گروه‌بندی بیماران
خروجی معمولاً مشخص و هدف‌دار ساختار کشف‌شده از داده

تفاوت یادگیری نظارت شده و یادگیری تقویتی

یادگیری تقویتی یا Reinforcement Learning نیز با یادگیری نظارت شده تفاوت اساسی دارد. در یادگیری نظارت شده، مدل نمونه‌هایی را مشاهده می‌کند که پاسخ صحیح آن‌ها مشخص است. اما در یادگیری تقویتی، یک عامل (Agent) با یک محیط تعامل می‌کند و بر اساس نتیجه اقدامات خود پاداش یا جریمه دریافت می‌کند.

مثلاً در یک بازی:

Agent ← Action ← Environment ← Reward

بنابراین در یادگیری تقویتی لزوماً برای هر وضعیت، پاسخ صحیح از قبل در اختیار مدل قرار ندارد.

کاربردهای یادگیری نظارت شده

یادگیری نظارت شده در حوزه‌های مختلف کاربرد دارد.

پزشکی

  • تشخیص بیماری
  • پیش‌بینی ریسک بیماری
  • تحلیل تصاویر پزشکی
  • پیش‌بینی پاسخ بیمار به درمان

مالی

  • تشخیص تقلب
  • اعتبارسنجی مشتریان
  • پیش‌بینی ریسک اعتباری
  • پیش‌بینی قیمت یا بازده

بازاریابی

  • پیش‌بینی رفتار مشتری
  • پیش‌بینی ریزش مشتری
  • دسته‌بندی مشتریان
  • پیش‌بینی احتمال خرید

تجارت الکترونیک

  • پیشنهاد محصول
  • پیش‌بینی فروش
  • تشخیص تراکنش‌های مشکوک
  • پیش‌بینی تقاضا

پردازش زبان طبیعی

  • تشخیص احساسات
  • طبقه‌بندی متن
  • تشخیص اسپم
  • دسته‌بندی اسناد

بینایی ماشین

  • تشخیص اشیا
  • طبقه‌بندی تصاویر
  • تشخیص چهره
  • تشخیص عیوب محصولات

مزایا و محدودیت‌های یادگیری نظارت شده

مزایا

  • قابلیت پیش‌بینی: هدف اصلی بسیاری از مسائل یادگیری نظارت شده، پیش‌بینی خروجی برای داده‌های جدید است.
  • ارزیابی نسبتاً مشخص: از آنجا که پاسخ صحیح داده‌های آزمون مشخص است، می‌توان عملکرد مدل را با معیارهای مختلف اندازه‌گیری کرد.
  • کاربردهای گسترده: این روش در پزشکی، مالی، بازاریابی، صنعت، حمل‌ونقل و بسیاری از حوزه‌های دیگر کاربرد دارد.
  • وجود الگوریتم‌های متنوع: از مدل‌های ساده مانند Linear Regression تا مدل‌های پیچیده مانند شبکه‌های عصبی و الگوریتم‌های Boosting می‌توان استفاده کرد.

محدودیت‌ها

  • نیاز به داده‌های برچسب‌دار: مهم‌ترین چالش، تهیه داده‌های دارای برچسب است. در بسیاری از پروژه‌ها، برچسب‌گذاری داده‌ها به زمان، هزینه و نیروی انسانی زیادی نیاز دارد.
  • کیفیت برچسب‌ها: اگر برچسب‌های آموزشی اشتباه یا ناسازگار باشند، مدل نیز ممکن است الگوهای اشتباه را یاد بگیرد.
  • وابستگی به داده آموزشی: عملکرد مدل تا حد زیادی به کیفیت و نمایندگی داده‌های آموزشی بستگی دارد.
  • خطر Overfitting: اگر مدل بیش از حد پیچیده باشد یا فرآیند آموزش به‌درستی کنترل نشود، احتمال Overfitting افزایش پیدا می‌کند.
  • سوگیری داده: اگر داده‌های آموزشی دارای Bias باشند، مدل نیز ممکن است همان سوگیری‌ها را در پیش‌بینی‌های خود منعکس کند.

چه زمانی از یادگیری نظارت شده استفاده کنیم؟

یک سؤال مهم این است که آیا هر مسئله یادگیری ماشین را باید با Supervised Learning حل کنیم؟ خیر. یادگیری نظارت شده زمانی گزینه مناسبی است که:

  • داده کافی در اختیار داشته باشیم؛
  • برای نمونه‌های آموزشی برچسب مشخص داشته باشیم؛
  • هدف مشخصی برای پیش‌بینی وجود داشته باشد؛
  • بخواهیم مقدار یا کلاس یک نمونه جدید را پیش‌بینی کنیم؛
  • بتوانیم عملکرد مدل را با یک معیار مشخص ارزیابی کنیم.

برای مثال اگر هدف شما این باشد که «با توجه به مشخصات مشتری، احتمال خرید او را پیش‌بینی کنم» یادگیری نظارت شده انتخاب مناسبی است. اما اگر هدف شما این باشد که «بدون داشتن برچسب، گروه‌های مختلف مشتریان را کشف کنم» احتمالاً باید به سراغ روش‌های یادگیری بدون نظارت بروید.

سؤالات متداول درباره یادگیری نظارت شده

یادگیری نظارت شده چیست؟
▾

یادگیری نظارت شده روشی از یادگیری ماشین است که در آن مدل با استفاده از داده‌های دارای برچسب (Labeled Data) آموزش می‌بیند و یاد می‌گیرد برای ورودی‌های جدید خروجی مناسب پیش‌بینی کند.

تفاوت Classification و Regression چیست؟
▾

در Classification خروجی یک کلاس یا دسته است (مثلاً اسپم/غیراسپم)، اما در Regression خروجی یک مقدار عددی پیوسته است (مثلاً قیمت خانه).

داده برچسب‌دار چیست؟
▾

داده برچسب‌دار داده‌ای است که علاوه بر ویژگی‌ها، پاسخ صحیح یا خروجی مورد انتظار نیز در آن مشخص است. مثلاً در تشخیص اسپم، برچسب «اسپم» یا «غیراسپم» برای هر ایمیل موجود است.

تفاوت یادگیری نظارت شده و بدون نظارت چیست؟
▾

در یادگیری نظارت شده داده‌ها برچسب دارند و هدف پیش‌بینی خروجی است، اما در یادگیری بدون نظارت داده‌ها برچسب ندارند و هدف کشف الگوها یا ساختارهای پنهان در داده است.

آیا یادگیری نظارت شده فقط برای مسائل طبقه‌بندی استفاده می‌شود؟
▾

خیر. یادگیری نظارت شده هم برای مسائل طبقه‌بندی (Classification) و هم برای مسائل رگرسیون (Regression) استفاده می‌شود.

چه زمانی باید از یادگیری نظارت شده استفاده کنیم؟
▾

زمانی که داده‌های برچسب‌دار کافی داریم و هدف مشخصی برای پیش‌بینی (کلاس یا عدد) وجود دارد، یادگیری نظارت شده گزینه مناسبی است.

جمع‌بندی

یادگیری نظارت شده یا Supervised Learning یکی از مهم‌ترین روش‌های یادگیری ماشین است که در آن مدل با استفاده از داده‌های دارای برچسب آموزش می‌بیند. مدل با مشاهده‌ی رابطه میان ورودی‌ها (Features) و خروجی صحیح (Label/Target) تلاش می‌کند الگوی موجود در داده‌ها را یاد بگیرد و سپس از این الگو برای پیش‌بینی نمونه‌های جدید استفاده کند.

دو نوع اصلی مسئله در یادگیری نظارت شده عبارت‌اند از:

  • Classification ← پیش‌بینی یک کلاس یا دسته
  • Regression ← پیش‌بینی یک مقدار عددی

الگوریتم‌هایی مانند Linear Regression، Logistic Regression، Decision Tree، Random Forest، SVM، KNN، Boosting و Neural Networks از مهم‌ترین روش‌هایی هستند که برای حل این مسائل استفاده می‌شوند.

با این حال، ساخت یک مدل خوب تنها به انتخاب الگوریتم محدود نمی‌شود. کیفیت داده، نحوه تقسیم داده‌ها، انتخاب ویژگی‌ها، جلوگیری از Overfitting و انتخاب معیار ارزیابی مناسب نیز نقش مهمی در موفقیت مدل دارند.

در یادگیری نظارت شده، مدل از نمونه‌هایی یاد می‌گیرد که پاسخ صحیح آن‌ها را می‌دانیم تا بتواند پاسخ نمونه‌های جدید را پیش‌بینی کند.

برای درک جایگاه این روش در تصویر بزرگ‌تر هوش مصنوعی و یادگیری ماشین، می‌توانید مقالات زیر را مطالعه کنید:

پژوهش موفق، ترکیبی از ابزارهای هوشمند و تفکر نقادانه است.


فکر خود را اینجا بگذارید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *