رگرسیون خطی چیست؟

ساخت وبلاگ

رگرسیون خطی ابزاری ساده برای مطالعه رابطه ریاضی بین دو متغیر است. در اینجا نحوه امتحان کردن آن برای خودتان آورده شده است.

نوشته شده توسط پیتر گرانت منتشر شده در 13 ژوئیه 2021

همکار ارشد مهندسی علمی در آزمایشگاه ملی لارنس برکلی پیتر گرانت یک متخصص کارآیی انرژی ساختمان در آزمایشگاه ملی لارنس برکلی است.

linear regression

تصور کنید که در یک شهر با یک مشکل زندگی می کنید. اخیراً باغبان در شهر شما به بیرون آمدن گنوم های باغ و آنها را به طرز زشت و زشت و زشتی گرفته اند. باغبانان حتی شروع به رقابت کرده اند تا ببینند چه کسی می تواند بزرگترین گنوم را در باغ خود قرار دهد. بدیهی است ، این ایستاده نخواهد بود. شهردار می داند که شما یک دانشمند داده مشتاق هستید و برای کمک به شما نزدیک می شود. او از کسی می خواهد که موقعیت مکانی همه گنوم ها را ردیابی کند و راهی برای پیش بینی مکان های خود ایجاد کند. این یک کار مسخره است ، اما کسی مجبور است این کار را انجام دهد. همانطور که معلوم است ، گنوم های باغ همه در یک خط مستقیم از طریق شهر قرار می گیرند. این بدان معناست که اگر می دانید که در آن واقع در شمال-جنوب یا شرق-غرب قرار دارد ، می توانید ابزارهایی ایجاد کنید که موقعیت مکانی یک باغ را به شما بگوید. به عبارت دیگر: رگرسیون خطی.

رگرسیون خطی چیست؟

رگرسیون خطی عمل محاسبه آماری یک خط مستقیم است که نشان دهنده رابطه بین دو مورد مختلف است. رگرسیون خطی ساده ترین شکل رگرسیون است. دو ویژگی وجود دارد که این مورد را ایجاد می کند. اول ، رگرسیون خطی فقط قادر به گرفتن روابط خطی هستند. ثانیا ، رگرسیون خطی فقط قادر به دستیابی به روابط بین دو متغیر است.

در این حالت رابطه بین محل گنوم های باغ در بعد شرقی-غرب و موقعیت گنوم های باغ در بعد شمال و جنوب خواهد بود. نتیجه یک معادله واحد است که شما را به محاسبه یکی در صورت شناختن دیگری می دهد. توجه داشته باشید که رگرسیون خطی ساده ترین شکل رگرسیون است. دو ویژگی وجود دارد که این مورد را ایجاد می کند. اول ، این تنها قادر به ضبط روابط خطی است. اگر یک روند نمایی در داده های شما وجود دارد ، بهتر است از آن استفاده نکنید. لگاریتمی؟نه ، نه این. روش هایی برای ماساژ داده ها برای استفاده از رگرسیون خطی در آن مجموعه داده ها وجود دارد ، اما بلافاصله نمی توان آن را انجام داد. ثانیا ، رگرسیون خطی فقط قادر به دستیابی به روابط بین دو متغیر است. اگر بیش از دو متغیر در مجموعه داده های خود دارید ، باید به جای آن به دنبال رگرسیون چندگانه باشید. گفته می شود ، از آنجا که رگرسیون خطی ساده ترین شکل رگرسیون است ، یک نقطه شروع خوب است. اطلاعات بیشتر از متخصصان ما مقدمه ای برای تقسیم بندی ، همبستگی و مدل سازی سری زمانی

رگرسیون خطی برای چه چیزی استفاده می شود؟

در رگرسیون خطی اصلی آن راهی برای محاسبه رابطه بین دو متغیر است. فرض بر این است که بین دو متغیر ارتباط مستقیمی وجود دارد و این رابطه را می توان با یک خط مستقیم نشان داد.

رگرسیون خطی ساده ترین شکل رگرسیون است.

این دو متغیر متغیر مستقل و متغیر وابسته نامیده می شوند و به دلایل نسبتاً بصری به آنها داده می شود. متغیر مستقل به این دلیل نامگذاری شده است زیرا این مدل فرض می کند که می تواند رفتار کند اما به هر دلیلی به متغیر دیگر بستگی ندارد. متغیر وابسته برعکس است. این مدل فرض می کند که این یک نتیجه مستقیم از متغیر مستقل است و مقدار آن به متغیر مستقل بسیار وابسته است. رگرسیون خطی یک رابطه ریاضی خطی بین دو متغیر ایجاد می کند. اگر متغیر مستقل را بشناسیم ، به ما این امکان را می دهد تا متغیر وابسته را پیش بینی کنیم. بنابراین بیایید به گنوم های باغ برگردیم. ما می توانیم با مکان شرقی-غربی گنوم باغ به عنوان متغیر مستقل و مکان شمال-جنوب به عنوان متغیر وابسته ، یک رگرسیون ایجاد کنیم. سپس می توانیم محل شمال-جنوب هر GNOME را در شهر محاسبه کنیم تا زمانی که مکان شرقی-غربی آن را بدانیم. از آنجا که این یک شکل ساده از رگرسیون است ، معادله حاکم برای رگرسیون خطی نیز بسیار ساده است: y = b* x + a در اینجا متغیر وابسته است ، x متغیر مستقل است ، و a و b ضرایب تعیین کننده شیب و هستندرهگیری معادله.

نحوه محاسبه ضرایب در رگرسیون خطی

  • برای محاسبه پیش بینی ها برای هر مقدار x از معادله رگرسیون خطی ، با مقادیر A و B استفاده کنید.
  • با کم کردن پیش بینی برای آن x از داده های واقعی و شناخته شده ، خطا را برای هر مقدار x محاسبه کنید.
  • خطای همه نکات را برای شناسایی خطای کل از یک معادله رگرسیون خطی با استفاده از مقادیر برای A و B جمع کنید.

به خاطر داشته باشید که برخی از خطاها مثبت خواهند بود در حالی که دیگران منفی خواهند بود. با این وجود ، این خطاها یکدیگر را لغو می کنند و با وجود خطاهای موجود در هر دو قرائت ، خطای حاصل از آن به 0 نزدیک می شوند.

به عنوان مثال دو امتیاز ، یکی با خطای پنج و دیگری با خطا ی-10. در حالی که همه ما می دانیم که هر دو نکته باید به عنوان 15 نقطه خطای در نظر گرفته شود ، روشی که در بالا توضیح داده شد ، آنها را به عنوان پنج نقطه خطا منفی می دانست. برای غلبه بر این مشکل ، الگوریتم های توسعه مدل های رگرسیون خطی به جای خطا ، از خطای مربع استفاده می کنند. به عبارت دیگر ، فرمول محاسبه خطای شکل می گیرد:

خطا = (واقعی - پیش بینی) ²

از آنجا که مقادیر منفی Squared همیشه مقادیر مثبت را برمی گرداند ، این مانع از لغو خطاها از خارج شدن یکدیگر و ایجاد دقیق مدل های بد می شود.

از آنجا که مدل رگرسیون خطی خطای مربع را به حداقل می رساند ، محلول به عنوان کمترین راه حل مربع گفته می شود. این نام برای ترکیب A و B است که حداقل خطای مربع را بر روی مجموعه داده باز می گرداند. حدس زدن و بررسی A و B بسیار خسته کننده خواهد بود. استفاده از یک الگوریتم بهینه سازی امکان دیگری است ، اما احتمالاً وقت گیر خواهد بود.

خوشبختانه ، ریاضیدانان یک راه حل جبری برای این مشکل پیدا کرده اند. ما می توانیم با استفاده از دو معادله زیر ، کمترین راه حل مربع را پیدا کنیم:

B = همبستگی (x ، y) * μ (y) / μ (x)

a = میانگین (y) - b * میانگین (x)

در اینجا μ انحراف استاندارد را نشان می دهد ، میانگین نشان دهنده میانگین یا میانگین مقادیر y در مجموعه داده ها است ، و همبستگی یک مقدار است که نشان دهنده قدرت همبستگی بین این دو است.

توجه: اگر این کار را در پاندای بسته Python انجام می دهید ، می توانید از عملکرد DataFrame. Mean () استفاده کنید تا میانگین (y) را شناسایی کنید و Numpy تابعی برای یافتن همبستگی دارد. برای کسانی که با هیچ یک از این شرایط آشنا نیستند ، توصیه می کنم پایتون را برای تجزیه و تحلیل داده ها به عنوان راهی برای شروع کار بخوانید.

این واقعیت که این دو معادله کمترین راه حل مربع را برمی گردانند ، فوق العاده بصری نیست ، اما ما می توانیم خیلی سریع از آن استفاده کنیم. به معادله A. نگاه کنید. اساساً بیان می کند که ما به مقدار متوسط y (متغیر وابسته) در صورت میانگین مقدار x (متغیر مستقل) باز می گردیم. در تلاش است خطی را ایجاد کند که از مرکز مجموعه داده ها عبور کند.

اکنون به معادله B. نگاه کنید. این بیان می کند که مقدار متغیر وابسته y باید با انحراف استاندارد از زمان y تغییر کند ، همبستگی بین دو متغیر هنگامی که مقدار متغیر مستقل با انحراف استاندارد x تغییر می کند. به عبارت دیگر ، دو مقدار هر یک با یک انحراف استاندارد تغییر می کنند که توسط همبستگی بین این دو ضرب می شود.

چرا رگرسیون خطی کار می کند؟

ما به طور معمول از حداقل راه حل مربع به دلیل برآورد حداکثر استفاده می کنیم (می توانید توضیح خوبی در علم داده از ابتدا پیدا کنید). ما برآورد حداکثر احتمال را در مورد شناسایی مقدار به احتمال زیاد برای ایجاد یک مجموعه داده پایه گذاری می کنیم. یک مجموعه داده مبتنی بر یک پارامتر z را تصور کنید.

اگر واقعاً نمی دانید Z چیست ، می توانید مقدار Z را جستجو کنید که به احتمال زیاد مجموعه داده ها را به دست می آورد. این بدان معنا نیست که شما مقدار مناسبی را برای Z پیدا کرده اید ، اما مقدار Z را پیدا کرده اید که باعث می شود مجموعه داده های مشاهده شده محتمل ترین باشد.

ما می توانیم این نوع محاسبه را در هر نقطه داده در مجموعه داده ها اعمال کنیم و مقادیر A و B را محاسبه کنیم که باعث می شود مجموعه داده ها بیشتر شود. اگر مسابقه را اجرا کنید (که می توانید در علم داده از ابتدا پیدا کنید) می فهمید که کمترین راه حل مربع برای A و B همچنین حداکثر احتمال برای مجموعه داده ها را به حداکثر می رساند.

باز هم ، این ثابت نمی کند که این مقادیر مجموعه داده ها را هدایت می کنند اما می گویند که آنها محتمل ترین مقادیر هستند.

چگونه می دانم مدل رگرسیون خطی من کار می کند؟

مانند همه مدل ها ، ضروری است که آن را آزمایش کنید تا اطمینان حاصل شود که عملکرد خوبی دارد. این به معنای مقایسه پیش بینی های مدل با داده های واقعی در مجموعه داده های آموزش ، اعتبار سنجی و آزمایش است.

روش ترجیحی بسته به نوع مدل متفاوت است ، اما برای رگرسیون خطی به طور معمول ضریب تعیین یا مقدار R² را محاسبه می کنیم. ضریب تعیین ، میزان روند موجود در مجموعه داده ها را می توان به درستی توسط مدل رگرسیون خطی پیش بینی کرد. این یک مقدار از 0 تا 1 است که مقادیر پایین تر نشان دهنده تناسب بدتر و مقادیر بالاتر است که نشان دهنده تناسب بهتر است.

ما ضریب تعیین را بر اساس مجموع خطاهای مربع تقسیم شده بر اساس تنوع مربع کل مقادیر y از مقدار متوسط آنها محاسبه می کنیم. این محاسبه کسری از تغییر در متغیر وابسته را که توسط مدل ضبط نشده است ، به دست می آورد.

بنابراین ضریب تغییر یکی است - این مقدار. یا از نظر ریاضی:

r² = 1 - (مجموع خطاهای مربع) / (مجموع مربع)

(مجموع مربع ها) = جمع (y_i - میانگین (y)) ²

(مجموع خطاهای مربع) = جمع ((واقعی - پیش بینی) ²)

محدودیت های رگرسیون خطی چیست؟

درست مانند همه الگوریتم ها ، محدودیت هایی در عملکرد رگرسیون خطی وجود دارد.

همانطور که دیدیم ، مدل رگرسیون خطی فقط قادر به بازگشت خطوط مستقیم است. این امر باعث می شود که مطابقت با مجموعه داده ها با هر نوع منحنی ، مانند روندهای نمایی یا لگاریتمی ، کاملاً نامناسب باشد.

رگرسیون خطی فقط زمانی کار می کند که یک متغیر وابسته واحد و یک متغیر مستقل واحد وجود داشته باشد. اگر می خواهید چندین مورد از هر یک از افراد موجود در مجموعه داده های خود را درج کنید ، باید از رگرسیون متعدد استفاده کنید.

سرانجام ، از یک مدل رگرسیون خطی برای پیش بینی مقادیر خارج از محدوده مجموعه داده های آموزشی خود استفاده نکنید. هیچ راهی برای دانستن اینکه همان روندها خارج از مجموعه داده های آموزش وجود دارد وجود ندارد و ممکن است شما به یک مدل بسیار متفاوت برای پیش بینی رفتار مجموعه داده ها در خارج از آن محدوده نیاز داشته باشید. به دلیل این عدم اطمینان ، برون یابی می تواند به پیش بینی های نادرست منجر شود - و پس از آن هرگز آن گنوم ها را پیدا نخواهید کرد.

فارکس وکسب درامد...
ما را در سایت فارکس وکسب درامد دنبال می کنید

برچسب : نویسنده : مهدی اسدی بازدید : <-PostHit-> تاريخ : جمعه 20 مرداد 1402 ساعت: 14:21