طبقه بندی و رگرسیون دو گروه از مشکلات الگوریتم یادگیری ماشین نظارت شده است. یادگیری ماشین نظارت شده از الگوریتم ها برای آموزش یک مدل برای یافتن الگوهای در یک مجموعه داده با برچسب ها و ویژگی ها استفاده می کند. طبقه بندی پیش بینی می کند که کدام دسته از موارد بر اساس نمونه های برچسب زده شده از موارد شناخته شده تعلق دارد. رگرسیون رابطه بین یک برچسب نتیجه هدف و یک یا چند متغیر ویژگی را برای پیش بینی مقدار عددی مداوم تخمین می زند. بسیاری از الگوریتم های یادگیری تحت نظارت ، مانند درختان تصمیم گیری ، می توانند برای طبقه بندی یا رگرسیون استفاده شوند.
تجزیه و تحلیل رگرسیون آماری از نظر ریاضی رابطه بین یک متغیر وابسته و یک یا چند متغیر مستقل را تعیین می کند. انواع زیادی الگوریتم رگرسیون وجود دارد. رگرسیون خطی یک الگوریتم است که برای رگرسیون برای پیش بینی ارزش عددی استفاده می شود ، به عنوان مثال قیمت یک خانه. رگرسیون لجستیک یک الگوریتم است که برای طبقه بندی برای پیش بینی احتمال تعلق یک مورد متعلق به یک کلاس استفاده می شود ، به عنوان مثال احتمال اینکه یک ایمیل اسپم باشد.
رگرسیون خطی چیست؟
رگرسیون خطی از طریق مجموعه ای از نقاط داده برای تخمین رابطه بین برچسب نتیجه هدف و یک یا چند متغیر ویژگی به منظور پیش بینی یک مقدار عددی ، یک مدل خطی متناسب است. خروجی y (برچسب) را می توان به عنوان یک خط مستقیم تخمین زد که می تواند به صورت شرح داده شود:
y = رهگیری + ci * xi + خطا
در جایی که XI متغیرهای ورودی (ویژگی ها) و پارامترهای CI ، رهگیری و خطا ضرایب رگرسیون ، جبران ثابت و خطا هستند. ضرایب CI را می توان به عنوان افزایش متغیر وابسته (برچسب Y) برای افزایش واحد در متغیر مستقل مربوطه (ویژگی X) تفسیر کرد. در مثال ساده زیر ، از رگرسیون خطی برای تخمین قیمت خانه (برچسب Y) بر اساس اندازه خانه (ویژگی X) استفاده می شود.

فاصله بین نقاط x و y و خط قدرت اتصال بین متغیرهای مستقل و وابسته را تعیین می کند. شیب خط اغلب با استفاده از روش کمترین مربعات تعیین می شود که در آن جمع مربع های جبران نقاط روی منحنی به حداقل می رسد.

دو نوع اصلی رگرسیون خطی وجود دارد - رگرسیون خطی ساده و رگرسیون چند خطی. در رگرسیون خطی ساده ، از یک متغیر مستقل برای توضیح یا پیش بینی نتیجه یک متغیر وابسته واحد استفاده می شود. رگرسیون خطی چندگانه با استفاده از دو یا چند متغیر مستقل همان کار را انجام می دهد.
رگرسیون اغلب برای پیش بینی نتایج استفاده می شود. به عنوان مثال ، رگرسیون ممکن است برای یافتن همبستگی بین مسواک زدن به دندان و پوسیدگی دندان باشد. محور x فرکانس حفره ها در یک جمعیت خاص است و محور y فرکانس است که افراد در آن جمعیت دندان های خود را مسواک می زنند. هر شخص توسط یک نقطه در نمودار مشخص می شود که فرکانس مسواک زدن هفتگی و تعداد حفره های آنها را نشان می دهد. در یک مورد در دنیای واقعی ، نقاطی در سراسر نمودار وجود خواهد داشت ، زیرا حتی برخی از افرادی که مرتباً مسواک می زنند ، در حالی که برخی از افراد که اغلب مسواک نمی زنند از پوسیدگی دندان نجات می یابند. با این حال ، با توجه به آنچه در مورد پوسیدگی دندان شناخته شده است ، خطی که به لمس کردن تمام نقاط موجود در نمودار نزدیک می شود ، احتمالاً به پایین و سمت راست شیب خواهد شد.
یکی از کاربردهای مفید تجزیه و تحلیل رگرسیون هوا است. هنگامی که می توان یک همبستگی قوی بین متغیرها - مانند دمای اقیانوس در اقیانوس اطلس جنوب شرقی و بروز طوفان ها ایجاد کرد - یک فرمول می تواند برای پیش بینی وقایع آینده بر اساس تغییرات در متغیرهای مستقل ایجاد شود.
تجزیه و تحلیل رگرسیون همچنین می تواند در سناریوهای مالی مانند پیش بینی ارزش آینده یک حساب سرمایه گذاری بر اساس نرخ بهره تاریخی مفید باشد. در حالی که نرخ بهره از ماه به ماه دیگر متغیر است ، در دراز مدت ، الگوهای خاصی پدیدار می شوند که می توانند برای پیش بینی رشد و سرمایه گذاری با درجه ای از دقت استفاده شوند.
این تکنیک همچنین در تعیین همبستگی بین عواملی که رابطه آنها به طور شهودی آشکار نیست ، مفید است. با این حال ، مهم است که به یاد داشته باشید که همبستگی و علیت دو چیز متفاوت است. سردرگمی آنها می تواند به سوء استفاده های خطرناک منجر شود. به عنوان مثال ، فروش بستنی و فراوانی مرگ و میر غرق در غرق شدن به دلیل یک عامل سوم - تابستان - اما هیچ دلیلی وجود ندارد که باور کنیم خوردن بستنی هیچ ارتباطی با غرق شدن دارد.
اینجاست که رگرسیون خطی چندگانه مفید است. این چندین متغیر مستقل را برای پیش بینی نتیجه یک متغیر وابسته واحد بررسی می کند. همچنین فرض می کند که یک رابطه خطی بین متغیرهای وابسته و مستقل وجود دارد ، که باقیمانده ها (نقاطی که بالاتر از یا پایین تر از خط رگرسیون قرار دارند) طبیعی هستند و تمام متغیرهای تصادفی دارای یک واریانس محدود هستند.
از رگرسیون خطی چندگانه می توان برای شناسایی استحکام نسبی تأثیر مستقل بر متغیرهای وابسته و اندازه گیری تأثیر هر مجموعه واحد از متغیرهای مستقل بر متغیرهای وابسته استفاده کرد. این مفیدتر از رگرسیون خطی ساده در مجموعه های مشکل است که در آن عوامل زیادی در محل کار هستند ، مانند پیش بینی قیمت کالا.
یک نوع سوم به نام رگرسیون غیرخطی وجود دارد که در آن داده ها متناسب با یک مدل هستند و به عنوان یک عملکرد ریاضی بیان می شوند. متغیرهای متعدد معمولاً درگیر هستند و رابطه به عنوان منحنی به جای یک خط مستقیم نشان داده می شود. رگرسیون غیرخطی می تواند مدلهایی را با روابط خودسرانه بین متغیرهای مستقل و وابسته تخمین بزند. یک مثال متداول پیش بینی جمعیت با گذشت زمان است. در حالی که بین جمعیت و زمان رابطه محکمی وجود دارد ، رابطه خطی نیست زیرا عوامل مختلفی از سال به سال بر تغییرات تأثیر می گذارند. یک مدل رشد جمعیت غیرخطی باعث می شود پیش بینی هایی در مورد جمعیت برای مواقعی که در واقع اندازه گیری نشده اند انجام شود.
مقالات آموزش فارکس...
ما را در سایت مقالات آموزش فارکس دنبال می کنید
برچسب :
نویسنده : بهزاد فراهانی
بازدید : <-PostHit->
تاريخ : دوشنبه
16 مرداد
1402 ساعت: 23:01