GLM: متناسب با مدل های خطی عمومی

ساخت وبلاگ

GLM برای متناسب با مدلهای خطی عمومی استفاده می شود ، که با ارائه توضیحات نمادین از پیش بینی کننده خطی و شرح توزیع خطا مشخص شده است.

استفاده

GLM (فرمول ، خانواده = گاوسی ، داده ها ، وزن ها ، زیر مجموعه ها ، na. action ، start = null ، etastart ، mustart ، Offset ، control = لیست (…) ، model = true ، method = "glm. fit" ، x = false، y = true ، singular. ok = true ، تضاد = null ،…)

glm. fit (x ، y ، وزنه = rep (1 ، nobs) ، start = null ، etastart = null ، mustart = null ، reps = rep (0 ، nobs) ، family = gaussian () ، control = لیست ()رهگیری = درست ، singular. ok = true)

# S3 روش برای وزن GLM (شی ، نوع = c ("قبلی" ، "کار") ، ...)

استدلال

فرمول

یک هدف از کلاس "فرمول" (یا یک مورد که می تواند به آن کلاس مجبور شود): توصیف نمادین از مدل که باید تعبیه شود. جزئیات مشخصات مدل تحت "جزئیات" آورده شده است.

خانواده

شرح توزیع خطا و عملکرد پیوند که در مدل مورد استفاده قرار می گیرد. برای GLM این می تواند یک رشته کاراکتر باشد که نامگذاری عملکرد خانواده ، عملکرد خانواده یا نتیجه فراخوانی به یک عملکرد خانواده است. برای GLM. FIT فقط گزینه سوم پشتیبانی می شود.(برای جزئیات بیشتر در مورد عملکرد خانواده به خانواده مراجعه کنید.)

داده ها

یک قاب داده ، لیست یا محیط اختیاری (یا اجبار شیء توسط As. data. frame به یک قاب داده) حاوی متغیرهای موجود در مدل. اگر در داده ها یافت نشد ، متغیرها از محیط (فرمول) گرفته می شوند ، به طور معمول محیطی که از آن GLM خوانده می شود.

وزن

یک بردار اختیاری از "وزن های قبلی" که در فرآیند اتصالات مورد استفاده قرار می گیرد. باید یک وکتور عددی باشد.

زیرمجموعه

یک بردار اختیاری که زیر مجموعه ای از مشاهدات را که در فرآیند اتصالات مورد استفاده قرار می گیرد ، مشخص می کند.

NA. ACTION

تابعی که نشان می دهد چه اتفاقی می افتد وقتی داده ها حاوی سدیم هستند. پیش فرض توسط تنظیمات na. action از گزینه ها تنظیم شده است ، و در صورت عدم استفاده ، na. fail است. پیش فرض "کارخانه" na. omit است. مقدار احتمالی دیگر تهی است ، بدون اقدام. مقدار na. xclude می تواند مفید باشد.

شروع

مقادیر شروع پارامترها در پیش بینی کننده خطی.

اتی

مقادیر شروع برای پیش بینی کننده خطی.

سبوس

شروع مقادیر برای بردار میانگین.

انحراف

این می تواند برای مشخص کردن یک مؤلفه شناخته شده پیشینی که در پیش بینی خطی در هنگام اتصالات گنجانده شده است ، استفاده شود. این باید تهی یا یک بردار عددی با طول برابر با تعداد موارد باشد. به جای آن می توان یک یا چند اصطلاح جبران را در فرمول در نظر گرفت ، و اگر بیش از یک مشخص شود از مبلغ آنها استفاده می شود. به Model. Offset مراجعه کنید.

کنترل

لیستی از پارامترها برای کنترل فرآیند اتصال. برای glm. fit این به glm. control منتقل می شود.

مدل

یک مقدار منطقی که نشان می دهد آیا فریم مدل باید به عنوان جزئی از مقدار برگشتی گنجانده شود یا خیر.

روش

روش مورد استفاده در برازش مدلروش پیش فرض «glm. fit» از حداقل مربعات وزن دهی مجدد (IWLS) استفاده می کند: «model. frame» جایگزین، قاب مدل را برمی گرداند و برازش ندارد.

توابع برازش ارائه شده توسط کاربر را می توان به عنوان یک تابع یا یک رشته کاراکتری که یک تابع را نامگذاری می کند، با تابعی که همان آرگومان های glm. fit را می گیرد، عرضه کرد. اگر به عنوان یک رشته کاراکتر مشخص شود، از داخل فضای نام آمار جستجو می شود.

برای glm : مقادیر منطقی که نشان می دهد آیا بردار پاسخ و ماتریس مدل استفاده شده در فرآیند برازش باید به عنوان اجزای مقدار برگشتی برگردانده شوند یا خیر.

برای glm. fit: x یک ماتریس طراحی با بعد n*p است و y بردار مشاهدات به طول n است.

مفرد. ok

منطقی؛اگر FALSE یک تناسب منفرد یک خطا است.

تضادها

یک لیست اختیاریContrasts. arg مدل. matrix. default را ببینید.

رهگیری

منطقیآیا رهگیری باید در مدل نول گنجانده شود؟

هدف - شی

یک شی به ارث برده از کلاس "glm".

نوع

کاراکتر، مطابقت جزئی مجاز است. نوع وزن برای استخراج از شی مدل برازش شده. می توان به اختصار اشاره کرد.

برای glm: آرگومان هایی که برای تشکیل آرگومان کنترل پیش فرض در صورتی که مستقیماً ارائه نشده باشد استفاده می شود.

برای وزن ها: آرگومان های بیشتر به یا از روش های دیگر ارسال می شود.

ارزش

glm یک شی از کلاس را که از "glm" به ارث می برد، برمی گرداند که از کلاس "lm" ارث می برد. در ادامه این بخش ببینید. اگر از یک متد غیر استاندارد استفاده شود، شی نیز از کلاس (در صورت وجود) که توسط آن تابع برگردانده شده است، ارث می برد.

خلاصه تابع (به عنوان مثال summary. glm) می تواند برای به دست آوردن یا چاپ خلاصه ای از نتایج و تابع anova (یعنی anova. glm) برای تولید جدول تجزیه واریانس استفاده شود.

توابع دسترسی عمومی ضرایب , اثرات , برازش مقادیر و باقیمانده ها را می توان برای استخراج ویژگی های مفید مختلف مقدار بازگردانده شده توسط glm استفاده کرد.

وزن ها بردار وزن ها را استخراج می کند، یکی برای هر مورد در تناسب (بعد از زیرمجموعه و na. action).

یک شی از کلاس "glm" لیستی است که حداقل شامل اجزای زیر است:

بردار نامگذاری شده از ضرایب

باقیمانده های کاری، که باقیمانده ها در تکرار نهایی تناسب IWLS است. از آنجایی که موارد با وزن صفر حذف می شوند، باقیمانده کاری آنها NA است.

مقادیر میانگین متناسب ، با تبدیل پیش بینی کننده های خطی توسط معکوس عملکرد پیوند بدست آمده است.

رتبه عددی مدل خطی متناسب.

شیء خانوادگی استفاده شده است.

خط خطی در مقیاس لینک.

تا یک ثابت ، منهای دو برابر احتمال ورود به سیستم حداکثر. در جایی که معقول باشد ، ثابت به گونه ای انتخاب می شود که یک مدل اشباع دارای انحراف صفر باشد.

نسخه ای از معیار اطلاعاتی Akaike ، منهای دو برابر احتمال ورود به سیستم حداکثر به علاوه دو برابر تعداد پارامترها ، که از طریق مؤلفه AIC خانواده محاسبه می شود. برای خانواده های دوتایی و سمی پراکندگی در یک ثابت است و تعداد پارامترها تعداد ضرایب است. برای خانواده های گاوسی ، گاما و معکوس گاوسی پراکندگی از انحراف باقیمانده تخمین زده می شود و تعداد پارامترها تعداد ضرایب به علاوه یک است. برای یک خانواده گاوسی از پراکندگی استفاده می شود ، بنابراین این یک ارزش معتبر از AIC است ، اما برای خانواده های گاما و معکوس گاوسی اینطور نیست. برای خانواده هایی که از نظر شبه و شیوه ای متناسب هستند ، ارزش سدیم است.

انحراف برای مدل تهی ، قابل مقایسه با انحراف. مدل تهی شامل افست و رهگیری در صورت وجود یک مدل در مدل خواهد بود. توجه داشته باشید که اگر عملکرد پیوند به داده های غیر از میانگین متناسب بستگی داشته باشد ، این نادرست خواهد بود: یک جبران صفر را برای مجبور کردن یک محاسبه صحیح مشخص کنید.

تعداد تکرارهای IWLS استفاده شده است.

وزنهای کار ، یعنی وزنهای موجود در تکرار نهایی IWLS مناسب است.

وزنهای در ابتدا تأمین می شد ، اگر هیچ یک بردار 1 ثانیه نبود.

درجه باقیمانده آزادی.

درجه باقیمانده آزادی برای مدل تهی.

در صورت درخواست (پیش فرض) بردار y استفاده شده است.(این یک بردار حتی برای یک مدل دوتایی است.)

در صورت درخواست ، ماتریس مدل.

در صورت درخواست (پیش فرض) ، قاب مدل.

منطقیآیا الگوریتم IWLS داوری شده است که همگرا شده است؟

منطقیآیا مقدار مناسب در مرز مقادیر قابل دستیابی است؟

تماس همسان

فرمول تهیه شده

اصطلاحات مورد استفاده

آرگومان داده

بردار افست استفاده شده است.

مقدار آرگومان کنترل مورد استفاده.

نام عملکرد Fitter مورد استفاده (هنگامی که به عنوان یک رشته کاراکتر به GLM ()) یا عملکرد Fitter (در صورت ارائه به عنوان آن) ارائه می شود.

(در صورت لزوم) تضادهای مورد استفاده.

(در صورت لزوم) سابقه ای از سطح عوامل مورد استفاده در اتصالات.

(در صورت لزوم) اطلاعاتی که توسط model. frame در مورد کار با ویژه Na s بازگردانده شده است.

علاوه بر این ، متناسب بودن غیر خالی دارای مؤلفه های QR ، R و اثرات مربوط به تناسب خطی وزن نهایی است.

اشیاء کلاس "glm" معمولاً از کلاس c ("glm"، "lm") هستند، که از کلاس "lm" به ارث می رسد، و روش های خوب طراحی شده برای کلاس "lm" در مدل خطی وزن دار اعمال می شود. تکرار نهایی IWLSبا این حال، مراقبت لازم است، زیرا عملکردهای استخراج کننده برای کلاس "glm" مانند باقیمانده ها و وزن ها فقط جزء تناسب را با همان نام انتخاب نمی کنند.

اگر یک مدل glm دو جمله ای با دادن یک پاسخ دو ستونی مشخص شده باشد، اوزان برگردانده شده توسط prior. weights تعداد کل موارد است (با وزن موارد ارائه شده فاکتور می شود) و مولفه y نتیجه نسبت موفقیت ها است.

توابع اتصال

روش استدلال دو هدف را دنبال می کند. یکی این است که اجازه دهید قاب مدل بدون اتصال دوباره ایجاد شود. مورد دیگر این است که اجازه دهیم تابع برازش پیش فرض glm. fit با تابعی جایگزین شود که همان آرگومان ها را می گیرد و از الگوریتم برازش متفاوتی استفاده می کند. اگر glm. fit به عنوان یک رشته کاراکتر ارائه شود، از آن برای جستجوی تابعی از آن نام استفاده می شود که از فضای نام آمار شروع می شود.

کلاس بازگشتی شی توسط فیتر (در صورت وجود) به کلاسی که توسط glm برگردانده شده است اضافه می شود.

جزئیات

یک پیش بینی معمولی پاسخ فرم را دارد~شرایط که در آن پاسخ بردار پاسخ (عددی) است و اصطلاحات مجموعه ای از عبارت ها هستند که یک پیش بینی خطی را برای پاسخ مشخص می کنند. برای خانواده های دوجمله ای و شبه دوجمله ای، پاسخ می تواند به عنوان یک عامل (زمانی که سطح اول نشان دهنده شکست و همه موفقیت های دیگر است) یا به عنوان یک ماتریس دو ستونی با ستون هایی که اعداد موفقیت ها و شکست ها را نشان می دهند، مشخص شود. مشخصات شرایط فرم اول + دوم همه عبارت ها را در اول به همراه همه عبارت های دوم با حذف هر تکراری نشان می دهد.

مشخصات فرم first:second مجموعه ای از اصطلاحات را نشان می دهد که با در نظر گرفتن تأثیر متقابل همه عبارت ها در ابتدا با همه عبارت ها در دوم به دست می آیند. مشخصات اول * دوم نشان دهنده تلاقی اول و دوم است. این همان اولین + دوم + اول: دوم است.

عبارات موجود در فرمول دوباره مرتب می شوند به طوری که جلوه های اصلی اول می آیند، پس از آن فعل و انفعالات، همه مرتبه دوم، همه مرتبه سوم و غیره می آیند: برای جلوگیری از این امر، یک شی اصطلاح به عنوان فرمول ارسال می شود.

از وزنهای غیر تهی می توان استفاده کرد تا نشان دهد که مشاهدات مختلف پراکندگی های مختلفی دارند (با مقادیر وزنهای متناسب با پراکندگی). یا به طور معادل ، هنگامی که عناصر وزنه ها عدد صحیح مثبت هستند (w_i ) ، که هر پاسخ (y_i ) میانگین مشاهدات وزن (w_i ) است. برای یک GLM دوتایی از وزن های قبلی برای ارائه تعداد آزمایشات استفاده می شود که پاسخ نسبت موفقیت ها باشد: آنها به ندرت برای Poisson GLM استفاده می شوند.

GLM. FIT عملکرد اسب بخار است: به طور معمول به طور مستقیم خوانده نمی شود اما می تواند در جایی که بردار پاسخ ، ماتریس طراحی و خانواده قبلاً محاسبه شده باشد ، کارآمدتر باشد.

اگر بیش از یکی از Etastart ، Start و Mustart مشخص شود ، از اولین لیست استفاده می شود. اغلب توصیه می شود مقادیر شروع برای یک خانواده شبه و همچنین برای خانواده هایی با پیوندهای غیرمعمول مانند گاوسی ("ورود به سیستم") تهیه شود.

تمام وزن ها ، زیر مجموعه ها ، افست ها ، Etastart و Mustart به همان روش متغیرهای موجود در فرمول ارزیابی می شوند ، که ابتدا در داده ها و سپس در محیط فرمول است.

برای پیش زمینه پیام های هشدار دهنده در مورد "احتمالات مناسب عددی 0 یا 1" برای GLM های دوتایی رخ داده است ، به Venables & Ripley مراجعه کنید (2002 ، صص197--8).

منابع

Dobson ، A. J. (1990) مقدمه ای برای مدل های خطی تعمیم یافته. لندن: چاپمن و هال.

Hastie ، T. J. and Pregibon ، D. (1992) مدلهای خطی تعمیم یافته. فصل 6 مدل های آماری در S J. M. Chambers و T. J. Hastie ، Wadsworth & Brooks/Cole.

McCullagh P. and Nelder ، J. A. (1989) مدلهای خطی تعمیم یافته. لندن: چاپمن و هال.

Venables ، W. N. and Ripley ، B. D. (2002) آمار کاربردی مدرن با S. نیویورک: Springer.

همچنین ببینید

LM برای مدلهای خطی غیر کلی شده (که SAS آن را GLMS می نامد ، برای مدلهای خطی "عمومی").

loglin و loglm (توده بسته) برای متناسب کردن مدل های خطی (که GLM های دوتایی و پواسون هستند) به میزهای احتمالی.

BigGlm در بسته بندی BigLM برای یک روش جایگزین برای جارو کردن GLMS در مجموعه داده های بزرگ (به ویژه مواردی که بسیاری از موارد) دارند.

مری ، dangt و predict. glm نمونه هایی از GLM های دوتایی مناسب دارند.

مثال ها

#دویدن## دابسون (1990) صفحه 93: آزمایش کنترل شده تصادفی: حسابc(18,17,15,20,10,20,25,13,12) نتیجه3,1,9) رفتار3,3)چاپ (D. AD#> #خلاصه اجرا (GLM. D93)#> #دویدن## محاسبه AIC [از بسیاری جهات]:(A0 A12*c(LL) + 2*جاذب(ll، "DF") A21) + 2 * طول(Coef (GLM. D93))stopifnot (exprs =) #> #دویدن## نمونه ای با جبران خسارت از Venables & Ripley (2002 ، ص . 189) UTILS :: DATA (بی اشتهایی ، بسته = "جرم")Anorex. 1#> #دویدن#یک مثال گاما ، از McCullagh & Nelder (1989 ، صص 300-2)لخته شدن تو = c(5,10,15,20,30,40,60,80,100), lot1 = c(118,58,42,35,27,25,21,19,18), lot2 = c(69,35,26,21,18,16,13,12,12)) خلاصه (GLM (lot1~ ورود به سیستم(U) ، داده = لخته شدن ، خانواده = گاما)) خلاصه (GLM (lot2~ ورود به سیستم(U) ، داده = لخته شدن ، خانواده = گاما)) ## Aliased ("S"ingular) >1 ضریب NA (FSورود به سیستم(تو) + ورود به سیستم(تو^2) ، داده = لخته شدن ، خانواده = گاما)) ابزارها :: asserterror (به روز رسانی (fs ، singular. ok =دروغ) ، verbose =در ارتباط بودن()) ## >.. "تناسب مفرد با آن روبرو شد" #> #دویدن## برای نمونه ای از استفاده از یک شیء به عنوان یک فرمولنسخه ی نمایشی (GLM. VR)#> 

کد بالا را در مرورگر خود با استفاده از فضای کاری DataCamp

مقالات آموزش فارکس...
ما را در سایت مقالات آموزش فارکس دنبال می کنید

برچسب : نویسنده : بهزاد فراهانی بازدید : <-PostHit-> تاريخ : چهارشنبه 8 شهريور 1402 ساعت: 19:14