Learn-Co-Students/DSC-1-09-10-THE-PROBAIDAT

ساخت وبلاگ

این تعهد متعلق به هیچ شعبه ای در این مخزن نیست و ممکن است متعلق به یک چنگال در خارج از مخزن باشد.

شاخه ها/برچسب ها را تغییر دهید برچسب های شاخه شاخه ها را بارگیری نکرد چیزی برای نشان دادن برچسب ها را بارگیری نکرد چیزی برای نشان دادن

نام در حال استفاده

یک برچسب در حال حاضر با نام شاخه ارائه شده وجود دارد. بسیاری از دستورات GIT نام برچسب و شاخه را می پذیرند ، بنابراین ایجاد این شاخه ممکن است باعث رفتار غیر منتظره شود. آیا مطمئن هستید که می خواهید این شاخه را ایجاد کنید؟

لغو ایجاد رمز

  • محلی
  • مکاشه

https github cli با استفاده از URL وب از Git یا Checkout با SVN استفاده کنید. با CLI رسمی ما سریع کار کنید. بیشتر بدانید.

ورود به سیستم لازم

لطفاً برای استفاده از برنامه های کد وارد سیستم شوید.

راه اندازی دسک تاپ GitHub

اگر هیچ اتفاقی نمی افتد ، دسک تاپ GitHub را بارگیری کنید و دوباره امتحان کنید.

راه اندازی دسک تاپ GitHub

اگر هیچ اتفاقی نمی افتد ، دسک تاپ GitHub را بارگیری کنید و دوباره امتحان کنید.

راه اندازی Xcode

اگر هیچ اتفاقی نمی افتد ، Xcode را بارگیری کنید و دوباره امتحان کنید.

راه اندازی کد ویژوال استودیو

فضای کد شما یک بار آماده خواهد شد.

مشکلی برای تهیه فضای کدگذاری شما وجود داشت ، لطفاً دوباره امتحان کنید.

آخرین تعهد

آمار git

فایل ها

بارگیری آخرین اطلاعات متعهد انجام نشد.

نوع نام آخرین پیام تعهد زمان متعهد شدن رمز

readme. md

عملکرد چگالی احتمال (PDF)

تاکنون ما به متغیرهای تصادفی گسسته و نحوه محاسبه/تجسم عملکردهای توزیع آنها نگاه کرده ایم. در این درس ، ما با متغیرهای مداوم و عملکرد چگالی احتمال (PDF) به عنوان راهی برای مدل سازی احتمال وقوع چنین متغیرهایی برخورد خواهیم کرد.

تو خواهی توانست:

  • استفاده از محاسبه PDF ها را برای متغیرهای تصادفی با ارزش واقعی درک کنید
  • بین احتمال و تراکم احتمال تمایز قائل شوید
  • توطئه های برآورد چگالی را برای یک مجموعه داده معین در Seabo تجسم کنید
  • PDF ها را از طریق درون یابی محاسبه کنید

متغیرهای مداوم می توانند هر مقدار واقعی را به خود اختصاص دهند. به عنوان مثال ، بیایید بگوییم که ارتفاع شخص 6. 1 فوت است. چگونه می دانیم که آنها دقیقاً 6. 1 پا هستند؟اندازه گیری ما چقدر دقیق بود؟در واقعیت ، ارتفاع در واقع می تواند 6. 11 فوت ، 6. 09 فوت یا 6. 1000033 فوت باشد.

در نهایت ، ما نمی توانیم مقدار دقیق یک متغیر مداوم را شناسایی کنیم. درعوض ، ما می توانیم با توجه به یک ابزار اندازه گیری ، آن را با دقت مشخصی تقریب دهیم. این ظرافت های ریاضی هنگام بررسی احتمالات مرتبط با این مقادیر منجر به نکات جالبی می شود.

برای برنامه های کاربردی ، به یاد داشته باشید که قد ، وزن ، فشار خون و مقادیر دیگر که می توانند هر مقدار واقعی را در یک محدوده به خود اختصاص دهند ، متغیرهای مداوم هستند.

احتمال در مقابل چگالی احتمال

متغیرهای مداوم می توانند تعداد بی نهایت متغیرها را به خود اختصاص دهند. به عنوان مثال ، شما می توانید یک متغیر تصادفی Y داشته باشید که نشان دهنده ارتفاعات ممکن برای تعدادی از افراد در یک گروه نظرسنجی است که می تواند مطابق شکل زیر نشان داده شود:

با نگاهی به هیستوگرام فوق می توانیم ببینیم که بیشتر مقادیر در حدود میانگین (حدود 67 اینچ) قرار دارند. همانطور که از هر دو جهت از میانگین دور می شویم ، فرکانس مشاهدات باعث ایجاد دو دم در هر دو انتها می شود. خط قرمز فوق عملکرد "تراکم" احتمال را نشان می دهد ، در مقایسه با توابع احتمالی که با CDF و PMF دیدیم. یک عملکرد چگالی احتمال (PDF) به شناسایی مناطق موجود در توزیع که در آن مشاهدات بیشتر اتفاق می افتد کمک می کند ، یعنی متراکم تر است. به یاد داشته باشید که در حالی که با PMF ها سر و کار داشتیم ، توده را برای هر کلاس محاسبه کردیم. در مورد متغیر مداوم ، ما تعداد مشخصی از نتایج احتمالی را که در بالا توضیح داده شد ، نداریم. بنابراین در عوض ما یک تابع چگالی ایجاد می کنیم.

برای توزیع فوق ، میانگین منطقه در مقایسه با دمهایی که در y-axis منعکس شده است ، چگالی احتمال بالایی دارد. این نمونه ای از توزیع عادی است که ما به بعدی خواهیم پرداخت.

عملکرد چگالی احتمال (که به عنوان یک عملکرد توزیع احتمال نیز نامیده می شود) نشان داده شده در بالا ، تمام مقادیر ممکن برای ارتفاع را نشان می دهد ، که برای این مورد ، دارای یک مقدار نامحدود از امکانات است.

ما می توانیم از توابع چگالی احتمالی برای پاسخ به یک سؤال مانند: احتمال اینکه قد شخص بین 60 تا 70 اینچ باشد ، استفاده کنیم؟نوشته شده در نماد ، سوال مطرح می شود:

توابع احتمال برای تشخیص فواصل بسیار عالی است زیرا همانطور که در بالا نشان داده شده است ، شناسایی یک نقطه دقیق دشوار است. ارتفاع 6 فوت (72 اینچ) در واقع فاصله بین 5. 99 فوت و 6. 01 فوت در نظر گرفته می شود که این امر باعث می شود تا با این متغیر مداوم ، فاصله زمانی را داشته باشد. بنابراین ما باید هنگام خواندن توابع چگالی احتمال ، به خصوص در مورد اعداد دقیق ، مراقب باشیم. برای ارتفاعات ، در مورد احتمال اینکه هر شخصی دقیقاً 6 فوت وزن داشته باشد ، چه می شود؟نوشته شده در نماد ، سوال این خواهد بود:

با نگاهی به نمودار ، ممکن است فکر کنید که احتمال داشتن ارتفاع دقیقاً شش فوت آن 0. 05 یا 5 ٪ است ، اما این طور نیست. این ایده که 5 ٪ از مردم دقیقاً 6 فوت قد دارند فقط قابل تصور نیست. ارتفاعات از نظر میلی متر ، میکرومتر یا حتی نانومتر متفاوت است. این فرد می تواند 6. 00012 یا 5. 99987 فوت قد داشته باشد. در حقیقت ، احتمال اینکه کسی دقیقاً 6ft باشد صفر است. بنابراین برای گرفتن مقدار باید یک فاصله را تعریف کنیم. اگر فاصله خود را به عنوان ارتفاعات بین Say 71. 9 و 72. 1 اینچ تنظیم کنیم ، می توانیم این را به صورت:

و اکنون می توانیم بگوییم این فاصله احتمال 5 ٪ از افراد در داده ها را ضبط می کند. عرض چنین بازه ای را می توان با توجه به ماهیت داده های مورد نظر و همچنین میزان دقت مورد نیاز تعیین کرد.

منطقه زیر منحنی

راه دیگر برای بررسی این موضوع در هنگام ترسیم "منطقه" دقیقاً 72 اینچ است ، در واقع فقط یک خط 1 بعدی خواهد بود و به هیچ وجه مساحت ندارد (یعنی احتمال = 0). بنابراین ما باید فواصل را برای متغیرهای مداوم اندازه گیری کنیم همانطور که در زیر آمده است:

بازنمایی رسمی ریاضی برای محاسبه یک منطقه در زیر منحنی در زیر نشان داده شده است:

PDF تابع احتمال F (x) است ، به گونه ای که x بین دو مقدار (a و b) قرار می گیرد ، برابر با انتگرال (ناحیه زیر منحنی) از a تا b است

ما هنگام صحبت در مورد احتمالات با توزیع های عادی ، این موضوع را با جزئیات بررسی خواهیم کرد. بیایید به یادگیری برخی از مهارت ها برای تخمین و ترسیم چنین عملکردهای چگالی در پایتون حرکت کنیم.

تجسم توابع چگالی احتمال

PDF ها را می توان با استفاده از هیتوگرام و توطئه های چگالی تجسم کرد. ما در مورد هیستوگرام بسیار تمرین کرده ایم. اکنون باید به چگونگی ترسیم یک طرح چگالی برای توزیع در پایتون بپردازیم.

برآورد چگالی و طرح ریزی

یک طرح چگالی یک نسخه "صاف" از هیستوگرام است که از مشاهدات تخمین زده می شود. تخمین عملکرد چگالی از داده های داده شده می تواند از روشهای پارامتری یا غیر پارامتری استفاده کند.

روشهای پارامتری از پارامترهایی مانند میانگین و انحراف استاندارد داده های داده شده استفاده می کنند و سعی می کنند شکل توزیع را که متعلق به آن است ، انجام دهد. اینها ممکن است مفهوم حداکثر احتمال متناسب با داده های داده شده را پیاده سازی کند.

برآورد چگالی هسته یا KDE یک روش تخمین غیر پارامتری متداول برای ترسیم یک منحنی (هسته) در هر نقطه داده های فردی است. این منحنی ها سپس برای ترسیم یک تخمین چگالی صاف اضافه می شوند. هسته که اغلب مورد استفاده قرار می گیرد یک گاوسی است (که در هر نقطه داده منحنی زنگ را تولید می کند). هسته های دیگر را می توان در موارد خاص استفاده کرد که توزیع اساسی طبیعی نباشد.

تخمین هیستوگرام (سمت چپ) و هسته (سمت راست) با استفاده از همان داده ها ساخته می شوند. 6 هسته منحصر به فرد منحنی های شکسته قرمز است ، چگالی هسته منحنی های آبی را برآورد می کند. خطوط عمودی سیاه و سفید در محورهای X "طرح فرش" نامیده می شوند.

در این مرحله ، اجازه دهید یک مقدمه سریع به شما ارائه دهیم. به یکی دیگر از کتابخانه های تجسم محبوب به نام Seabo ، که می تواند شگفتی هایی را برای تجسم آماری انجام دهد. ما به سرعت در این مرحله به توطئه های چگالی می پردازیم و دوباره در بخش بعدی دوباره بررسی می کنیم تا پتانسیل کامل آن را برجسته کنیم.

بیایید ابتدا این ماژول را به محیط خود وارد کنیم.

وارد كردن دریایی as اسنک

عملکردی که در حال حاضر به آن علاقه مندیم ، عملکرد Seabo. distplot () در Seabo است که می تواند به تجسم توزیع به تعدادی از روشهای آماری از جمله هیستوگرام ، توطئه های چگالی ، توطئه های منطقه با طیف عظیمی از ویژگی های رنگ آمیزی و سفارشی کمک کند.

Seabo. distplot (a ، bins = none ، hist = true ، kde = true ، rug = falt ، fit = none ، none ، kde_kws = none ، rug_kws = هیچ ، fit_kws = هیچ ، رنگ = هیچ ، عمودی = نادرست ،norm_hist = false ، axlabel = none ، label = none ، ax = none) 

وای .. مقدار گزینه های موجود در آنجا را بررسی کنید ، یک آن یک شیء محور Matplotlib را برای تغییر بیشتر و زیباتر کردن آن باز می گرداند. در اینجا مستندات رسمی است - برو کاوش.

ما باید از مجموعه داده هایی به نام داده های وزن و قد استفاده کنیم که حاوی 10،000 مشاهدات در مورد ارتفاع و وزن افراد است که به عنوان زن زن گروه بندی می شوند. بیایید مجموعه داده ها را در محیط پایتون خود بارگیری کنیم.

وارد كردن منگوله.پیلت as PLT PLT.سبک.استفاده کنید('ggplot') وارد كردن پاندا as pd داده ها = pd.read_csv("وزن-ارتفاع. csv") چاپ(داده ها.سر()) داده ها.توصیف کردن()
 وزن جنسیت 0 نر 73. 847017 241. 893563 1 مرد 68. 781904 162. 310473 2 مرد 74. 110105 212. 740856 3 مرد 71. 730978 220. 042470 4 مرد 69. 881796 206. 349801 

. dataframe tbody tr th: فقط از نوع

. dataframe tbody tr th< vertical-align: top; >. dataframe thead th
قد وزن
شمردن 10000. 000000 10000. 000000
منظور داشتن 66. 367560 161. 440357
std 3. 847528 32. 108439
حداقل 54. 263133 64. 700127
25 ٪ 63. 505620 135. 818051
50 ٪ 66. 318070 161. 212928
75 ٪ 69. 174262 187. 169525
حداکثر 78. 998742 269. 989699

بیایید طرح چگالی را برای داده ها در ستون ارتفاع با استفاده از seabo distplot () ترسیم کنیم. ما باید این طرح را در اینجا ایجاد کنیم و این طرح را برای برجسته کردن توانایی های قدرتمند تجسم Seabo ایجاد کنیم. برای این داده ها ، ما در حال ترسیم خواهیم بود:

  • یک جعبه و طرح ویسکرها
  • هیستوگرام
  • طرح تخمین چگالی هسته غیر پارامتری
  • طرح مناسب توزیع پارامتری
  • گزینه های سفارشی سازی را با استفاده از کلمات کلیدی Object خاص _kws ارائه دهید<>

.. همه در یک حرکت.

وارد كردن بی پروا.آمار as آمار # دو زیرمجموعه عمودی ایجاد کنید که 15 ٪ و 85 ٪ از فضای نقشه را به اشتراک بگذارید # sharex اجازه می دهد تا محورها را به اشتراک بگذارید یعنی ساخت چندین توطئه در محورهای مشابه شکل, (ax, ax2) = PLT.قسمتهای فرعی(2, sharex=درست است، واقعی, gridspec_kw="قد_راتیوس": (. 15, . 85)>, شکل دادن = (10,8) ) اسنک.تقاطع(داده ها.قد, تاریخی=درست است، واقعی, hist_kws=< "خط پهنای باند": 2, "Edgecolor" :'ماهی سالمون', "آلفا": 0.4, "رنگ": "W", "برچسب": "هیستوگرام", >, kde=درست است، واقعی, kde_kws ="خط پهنای باند": 3, "رنگ": "آبی", "آلفا": 0.7, 'برچسب':"طرح تخمین چگالی هسته" >, مناسب= آمار.هنجار, fit_kws ="رنگ" : 'سبز', 'برچسب' : "تناسب پارامتری", "آلفا": 0.7, "خط پهنای باند":3>, ax=ax2) ax2.set_title("برآورد چگالی") اسنک.جعبه(x=داده ها.قد, ax = ax,رنگ = 'ماهی سالمون') ax.set_title('جعبه و توطئه ویسکرها') ax2.تنظیم(عالیه=(0, . 08)) PLT.عالیه(0,0. 11) PLT.افسانه()

png

بنابراین می بینید که چگونه می توانیم چندین جنبه آماری توزیع با Seabo را با چنین سهولت تجسم کنیم. این امر ما را از محاسبه هیستوگرام ، عادی سازی آنها ، یافتن احتمالات و غیره نجات داده است. می توانید این توطئه ها را بیشتر به محتوای قلب خود تنظیم کنید. برای گلوله های رنگی ، سبک ها ، گزینه های برچسب زدن و غیره به مستندات رسمی Seabo نگاهی بیندازید.

ما همچنین می توانیم از Seabo Distplot برای مشاهده عملکرد CDF برای متغیرهای یبوست استفاده کنیم. شما به استفاده از distplot () برای تجسم سریع در مورد جنبه های مختلف توزیع تحت مطالعه تشویق می شوید.

اسنک.تقاطع(داده ها.قد, hist_kws=مدرک(انباشته=درست است، واقعی), kde_kws=مدرک(انباشته=درست است، واقعی));

png

روش دیگر (نسبتاً ساده لوحانه - در عین حال مؤثر) تخمین عملکرد چگالی با استفاده از درون یابی بین قله های هیستوگرام است. ما می توانیم از تابع np. histogram برای محاسبه مقادیر هیستوگرام و درون یابی بین این مقادیر برای ترسیم منحنی چگالی استفاده کنیم.

وارد كردن اعماق as np n, سطل = np.بافت نگار(داده ها.قد, 20, تراکم=1) n , سطل
، 55. 49991378 ، 56. 73669423 ، 57. 97347468 ، 59. 21025513 ، 60. 4470358 ، 61. 68381603 ، 62. 92059648 ، 64. 1573737693 ، 65. 3941573415734157341573415734157341573415734157 ، 69. 10449874 ، 70. 34127919 ، 71. 57805964 ، 72. 81484009 ، 74. 05162054 ، 75. 28840099 ، 76. 52518144 ، 77. 7619619 ، 78. 99874235 

در اینجا مقادیر هیستوگرام و سطل ها موقعیت های سطل در امتداد x-axis هستند. ما می توانیم بین این مقادیر درون یابی کنیم تا نقاط منحنی چگالی را همانطور که در زیر آمده است محاسبه کنیم.

# آرایه های numpy را با توجه به تعداد سطل های دارای صفرها برای ذخیره مقادیر درون یابی آغاز کنید pdfx = np.صفر(n.اندازه) پی دیفی = np.صفر(n.اندازه) # از طریق سطل های هیستوگرام درون یابی # از نظر مختصات X و Y نقطه میانی بین دو سطل همسایه را مشخص کنید برای k in دامنه(n.اندازه): pdfx[k] = 0.5*(سطل[k]+سطل[k+1]) پی دیفی[k] = n[k] # منحنی محاسبه شده را ترسیم کنید PLT.طرح(pdfx, پی دیفی)

png

در آنجا ما آن را داریم. این طرح منعکس کننده عملکرد چگالی ما است. ما می توانیم اکنون آن را در بالای هیستوگرام عادی خود ترسیم کنیم و تصویری کامل از داده های اساسی بدست آوریم.

داده ها.قد.طرح.تاریخی(سطل = 20, هنجار=درست است، واقعی, برچسب = "هیستوگرام عادی", الفا = 0.7) # منحنی محاسبه شده را ترسیم کنید PLT.طرح(pdfx, پی دیفی, برچسب = "عملکرد چگالی") PLT.یلابل ("احتمالات") PLT.افسانه() PLT.عنوان ("PDF برای داده های ارتفاع") PLT.نشان دادن()

png

بنابراین اینجا است. هیستوگرام عادی ما با منحنی چگالی احتمال. ما باید به آزمایشگاه برویم و کمی بیشتر در مورد این ایده ها در کنار این مجموعه داده استفاده کنیم.

در این درس به عملکرد چگالی احتمال نگاه کردیم و تفاوت بین احتمالات نقطه را که با متغیرهای طبقه بندی دیدیم ، با عملکردهای چگالی احتمال برای متغیرهای مداوم مشخص کردیم. یک نکته بسیار مهم ، احتمال یک متغیر مداوم با یک مقدار دقیق صفر است! درعوض ، ما دیدیم که باید به احتمالات یک متغیر مداوم که با طیف وسیعی از مقادیر در حال سقوط است ، نگاه کنیم. این مربوط به محاسبه ناحیه بین این مرزها در زیر PDF است. ما در ادامه این ایده ها را در ادامه دروس بررسی خواهیم کرد.

کسب درآمد از فارکس...
ما را در سایت کسب درآمد از فارکس دنبال می کنید

برچسب : نویسنده : عسلی سهیال بازدید : <-PostHit-> تاريخ : جمعه 30 تير 1402 ساعت: 13:50