آیا مصرف انرژی در تمام زمان های سال به همان اندازه متغیر است ، یا برخی از هفته ها/فصول/ساعت ها از سایرین سازگار هستند؟ - نه! Q1 از انرژی بسیار سازگارتر برخوردار است و دارای طیف بسیار باریک انرژی مورد استفاده برای هر ساعت خاص از روز است. در همین حال ، Q2 میزان مصرف انرژی بسیار متناقض را نشان می دهد ، با تنوع زیادی به خصوص در ساعات عصر عصر با انرژی بالاتر.
نه تنها بلافاصله متوجه برخی الگوهای می شویم ، بلکه این دیدگاه از داده ها نیز به ما این فرصت را می دهد که فقط با نگاه دقیق تر (و انجام برخی تحقیقات اساسی در مورد آنچه در آن زمان در کالیفرنیا اتفاق می افتد) عمیق تر شویم.
بیایید در ساعات اولیه صبح Q3 نزدیکتر باشیم. مقادیر غیر طبیعی بالایی بین 4 بعد از ظهر و 6 بعد از ظهر وجود دارد. ابزارهای تعاملی نشان می دهد که این موارد در 19 اوت اتفاق افتاد. جستجوی سریع گوگل برای "کالیفرنیا 19 اوت 2020" نشان می دهد که این منطقه از آتش سوزی رنج می برد ، بنابراین شاید مردم به جای باز کردن پنجره های خود به شب خنک تر ، ویندوز را بسته و AC نگه داشته باشند. هوا. 6 سپتامبر همچنین در بین بالاترین ارزش ها نشان می دهد ، و یک جستجو علت احتمالی را نشان می دهد: یک موج گرمای رکورددار در کالیفرنیا که در حالی که آتش سوزی ها به سوختند ، به اخبار ملی رسید.
به طور کلی ، نمودار ماپ تیک تیک تیک تیک تیک همان تعداد داده های خط اصلی را دارد ، اما اکنون می توانیم الگوهای روزانه و فصلی را مشاهده کنیم (و الگوهای روزانه در فصلی متفاوت است) و همچنین مساحت نسبی. هرچه زمان بیشتری را با نمودار بگذرانیم ، بیشتر متوجه می شویم ، زیرا ما را دعوت می کند تا سؤالات جدید محور داده را بپرسیم.
2: ابتدا تقویت ، سپس گروه یا رنگ
دانش مشترک را بیاورید: تقویت با طبقه بندی های آشنا
در یک نقطه دیگر از تجزیه و تحلیل اکتشافی ما ، ما به نمودار نگاه کردیم که 52 هفته مصرف انرژی ساعتی در کالیفرنیا (نشان داده شده در بالا) را نشان داد و متوجه شدیم که هفته های انرژی بالاتر هر روز یک برآمدگی واحد در عصر در حالی که هفته های کم مصرف است ، به نظر می رسدبه نظر می رسید که بیشتر از یک دست انداز مضاعف برخوردار است (به بالا مراجعه کنید). این در واقع همان الگویی است که در بخش شماره 1 در تنظیم مجدد نشان داده شده است.
ما حدس زدیم که ممکن است دست انداز/دوتایی منفرد با اختلافات فصلی در دما باشد. برای آزمایش این فرضیه ، یک ستون به مجموعه داده ها اضافه کردیم تا "تابستان" در مقابل "زمستان" را تعیین کنیم و سپس با تقسیم داده ها بر روی آن پارامتر ، دو نمودار (FaceTed) درست کردیم. ناگهان واضح بود. دیگر ما در تلاش نبودیم تا متوجه الگویی که در چاله ها پنهان شده بود ، متوجه شویم.
خود "جنبه" ساده بود ، ویژگی ای که در بسیاری از API های نمودار از جمله طرح قابل مشاهده (که ما برای تجسم داده های خود استفاده می کردیم) ساخته شده است. در ضمن ، این به نظر می رسد یک روش آشکار برای تقسیم داده ها است. اما چند بار ما به عقب برگردیم و در واقع داده های خود را با این مفاهیم مرتبط با انسان تقویت می کنیم؟نکته اصلی داشتن پارامتر تابستان/زمستان برای Facet بود.
لازم نیست کامل باشد. حدس زدن در مرز تاریخ برای تابستان/زمستان کافی است تا ببینیم الگوی مشخصی پدیدار می شود. هنگامی که ما بینش دو ضربه ای/تک ضربه ای را در اینجا قابل مشاهده داریم ، می توانیم از این بینش استفاده کنیم تا به عقب برگردیم و داده های خود را از نزدیک نگاه کنیم. به عنوان مثال ، به نظر می رسد که هفته های روزانه "دوتایی" در "تابستان" وجود دارد. آیا آن هفته های مرزی که باید به عنوان زمستان (یا پاییز یا بهار) طبقه بندی شوند؟یا آیا آنها هفته های غیرمعمول در طول تابستان هستند؟علاوه بر این ، اکنون که ما یک سیگنال تعیین کننده را می شناسیم ، می توانیم از آن سیگنال برای طبقه بندی داده ها استفاده کنیم و از این طریق از داده ها استفاده کنیم تا هنگام انتقال مصرف انرژی از الگوی "تابستان" به الگوی "زمستان" شناسایی شود.
تقویت با طبقه بندی داده های محور
این نمودار خط استفاده روزانه انرژی توسط یک خانواده واحد در آتلانتا از مارس تا ژوئیه 2021 را نشان می دهد. بسیاری از سنبله ها؟مصرف انرژی بالاتر در ماه های تابستان؟
جابجایی به یک پراکندگی باعث می شود که روزهای انرژی عادی و همچنین روزهای پر انرژی وجود داشته باشد. ترسیم در یک خط برای میانگین متحرک به علاوه A بافر (5 کیلووات ساعت) این شکاف را بین روزهای "عادی" و "انرژی بالا" روشن تر می کند و نشان می دهد که این شکاف حتی با افزایش کل مصرف انرژی در ماه های تابستان حفظ می شود.
اکنون که تجزیه و تحلیل داده های اکتشافی ما دو دسته مجزا (طبیعی و پر انرژی) را نشان داده است ، می توانیم با استفاده از میانگین متحرک ، داده های خود را تقویت کنیم تا تعریف کنیم که کدام نقاط در هر گروه قرار می گیرند. سپس می توانیم نقاط را با آن طبقه بندی های جدید رنگ کنیم تا تجزیه و تحلیل آسان تر شود.
به این ترتیب ، ما دایره را تکمیل می کنیم: ما از تجسم استفاده می کنیم تا به یک ویژگی اصلی داده ها توجه کنیم و از این بینش استفاده کنیم تا داده های خود را طبقه بندی کنیم و تجسم را آسانتر می کنیم. و ما می توانیم آن را یک قدم جلوتر برداریم و با ایجاد یک هیستوگرام که نشان دهنده فراوانی با انرژی بالا در مقابل روزهای استفاده عادی در ماه است ، به تجزیه و تحلیل داده های خود بر اساس این طبقه بندی ادامه دهیم. در این دیدگاه ، می بینیم که در تابستان میزان انرژی مورد استفاده در روزهای عادی بالا می رود و روزهای پر انرژی در ماه ژوئن و ژوئیه نسبت به مارس و آوریل وجود داشت (حتی پس از در نظر گرفتن آن که انرژی پایهاستفاده نیز بالا رفت). بنابراین ، اکنون می توانیم با اطمینان بگوییم که مصرف انرژی کلی به دو دلیل افزایش یافته است: (1) استفاده از انرژی پایه افزایش یافته و (2) درصد بالاتری از روزها روزهای پر انرژی بود.
این الگوی نگاه کردن ، سپس تقویت ، سپس با استفاده از طبقه بندی دوباره می تواند هرگونه مسئله در طبقه بندی ما را نشان دهد ، مانند نقطه ای که در روز ششم داده های ما رخ داده است که گمراه شده است زیرا میانگین متحرک تا روز هفتم تعریف نشده است (به عنوان یک میانگین متحرک در حال حرکت). این به ما فرصتی می دهد تا الگوریتم طبقه بندی خود را بهبود بخشیم.
در حالی که این مثال از یک الگوریتم بسیار ساده از "حرکت متوسط + 5kwh" برای طبقه بندی روزها به عنوان "عادی" یا "انرژی بالا" استفاده کرده است ، این چرخه "نگاه ، تقویت ، نگاه کردن ، طبقه بندی پالایش" برای یادگیری ماشین به عنوان ما مهمتر می شودالگوریتم ها مات تر می شوند.
3: داده های خود را به پیش زمینه و پس زمینه تقسیم کنید
بر اساس یک دوره زمانی مورد علاقه تقسیم شود
ما همچنین به داده های مربوط به انرژی تولید شده توسط نوع سوخت در تگزاس در ژانویه و فوریه سال 2021 ، از جمله یک دوره زمانی مهم در ماه فوریه منتهی به و در هنگام خاموشی های نورد که برای نجات شبکه برق از فروپاشی پس از طوفان غیرمعمول زمستانی آغاز شده است ، حفر کردیم. واددر داستان تجزیه و تحلیل ، همکار من ایان داده ها را جلوه داد و برای هر نوع سوخت نمودار ایجاد کرد. این کاملاً مؤثر بود: شما می توانید فوراً ببینید که کدام سوخت ها بخش عمده ای از انرژی را در تگزاس و همچنین برخی از الگوهای غیر طبیعی در اواسط فوریه تشکیل می دهند.
با دانستن اینکه دوره زمانی بحرانی در حدود 7 فوریه تا 21 فوریه بود ، ایان با ساختن هفته های قبل و بعد از تا حدی شفاف و اضافه کردن شبکه های عمودی ، بیشتر به آن دو هفته توجه کرد. او ممکن است وسوسه شده باشد تا داده ها را خارج از دوره حذف کند. از این گذشته ، چرا فضای خارج از مدت زمان مورد علاقه ، فضای داده را در داده ها هدر می دهد؟
اما این داده های پس زمینه گرانول است که به ما کمک می کند تا در دوره زمانی بحرانی چه چیزی برای هر نوع سوخت غیر معمول باشد. به عنوان مثال ، در ذغال سنگ ما بعد از 15 فوریه بدون در نظر گرفتن ، متوجه می شویم ، اما ما از ژانویه به داده ها نیاز داریم تا متوجه شویم که فلات تقریباً مسطح بین 1 فوریه و 15 فوریه چقدر غیر معمول است. به همین ترتیب ، داده های ژانویه و اواخر فوریه برای هسته ای نشان می دهد که این منبع سوخت به طور معمول چقدر ثابت است و به ما کمک می کند تا درک کنیم که شیب که بعد از 15 فوریه می بینیم چقدر عجیب است.
تقسیم با مقایسه هر دسته از علاقه ها با مجموعه داده های کامل
وقتی می خواهیم بدانیم بین متریک A و متریک B رابطه وجود دارد ، اولین قدم ایجاد یک پراکندگی است. به عنوان مثال ، ScatterPlot زیر دمای فضای باز و تقاضای انرژی در تگزاس را برای هر ساعت در طی یک سال نشان می دهد. بلافاصله روشن است که بین دما و مصرف انرژی رابطه محکمی وجود دارد (حتی اگر این رابطه نیز به وضوح غیر خطی باشد!).
در حالی که به وضوح بین دما و تقاضای برق همبستگی وجود دارد ، همچنین مشخص است که دما کل داستان را نمی گوید. برای هر دمای معین ، اختلاف تقریباً 10-15 کیلو وات ساعت از حداقل تا حداکثر مصرف انرژی وجود دارد. با دانستن اینکه در خانه های خودمان در یک بعد از ظهر سرد ترموستات را بیشتر از یک شب سرد می کنیم ، حدس می زنیم که ساعت روز می تواند نقش اساسی در رابطه بین دما و مصرف انرژی داشته باشد.
رویکرد استاندارد برای افزودن یک دسته اضافی به یک پراکندگی ، استفاده از یک رنگ طبقه بندی شده است ، در نتیجه همه چیز را با همه چیز مقایسه می کند (مقایسه همه ساعت ها ، دما و تقاضای انرژی در یک نمودار). اگر این کار را انجام دهیم ، می بینیم که چیزی در جریان است. سبزیجات و بلوز بیشتر در بالا سمت راست ، پین های بیشتر کم است. اما برای فهمیدن رنگها به چه مواردی ، باید بین افسانه و داده ها به عقب و جلو نگاه کنید. علاوه بر این ، پاسخ دادن به سوالی مانند "رابطه دما و انرژی در ساعت 10 صبح چیست؟"یا ، "صبح زود چگونه با عصر مقایسه می شود؟
در عوض می توانیم دو تکنیک را اعمال کنیم: گروه بندی و تقسیم داده ها به پیش زمینه و پس زمینه.
در سه نمودار زیر ، نقاط نمایانگر 5 صبح ، 10 صبح و 6 بعد از ظهر به رنگ روشن هستند. در همین حال ، کل مجموعه داده ها در پس زمینه به رنگ خاکستری نشان داده شده است. این امر به ما این زمینه را می دهد تا رابطه بین دما و انرژی را برای هر ساعت ببینیم و ببینیم که در متن مجموعه داده های کامل.
با مقایسه خاص "5 صبح" با "سایر ساعات دیگر روز" ، می توانیم ببینیم که 5 صبح بدون در نظر گرفتن دما ، مصرف انرژی نسبتاً کم است (و درجه حرارت هرگز در 5 صبح خیلی زیاد نیست). در ضمن ، در 6 بعد از ظهر مصرف انرژی به طور کلی در تمام دما بیشتر است.
10 صبح از بعضی جهات جالب ترین است: در دماهای پایین تر (در نیمه سمت چپ نمودار) نقاط زرد در مقایسه با نقاط خاکستری نسبتاً زیاد هستند ، که نشانگر مصرف انرژی زیاد نسبت به ساعات دیگر روز در همان دما است. در همین حال ، برای دمای زیاد در نیمه سمت راست نمودار ، نقاط زرد در قسمت زیرین خاکستری را در آغوش می گیرند. در دمای گرم ، انرژی نسبتاً کمی در 10 صبح در مقایسه با بقیه روز استفاده می شود. این نوع بینش نه تنها با گروه بندی ، بلکه با استفاده از مجموعه داده کامل "پر سر و صدا" به عنوان یک پس زمینه سازگار فراهم می شود که زمینه ای را برای همه نمودارهای صورت فراهم می کند.
خلاصه: پیچیدگی داده های خود را در آغوش بگیرید
در جریان ایجاد جمع آوری داده های سری زمانی تجزیه و تحلیل ، یان جانسون ، مایک فریمن و من از طیف وسیعی از استراتژی ها استفاده کردیم تا به جای تکیه بر روشهای استاندارد که آن را از بین می برد ، پیچیدگی داده ها را در آغوش بگیریم. آن خطوط ناامیدکننده سیگنال هستند ، نه سر و صدا.
ما پیچیدگی را در آغوش گرفتیم:
- تنظیم مجدد داده ها برای مقایسه "دوست داشتن".
- افزایش داده های ما بر اساس مفاهیمی که ما می دانیم مهم و در مورد آنچه در داده ها کشف کردیم.
- با استفاده از مجموعه داده بزرگتر برای ارائه زمینه پس زمینه برای داده های مورد علاقه (پیش زمینه).
این رویکردها به ویژه برای داده های سری زمانی قدرتمند هستند زیرا الگوهای زیرزمینی روزانه ، هفتگی و فصلی می توانند احساس حواس پرتی کنند. به طور خاص ، در نظر بگیرید که چگونه این استراتژی ها می توانند با قرار دادن داده های ورودی در یک زمینه تاریخی غنی تر برای تطبیق سریع الگوی بصری برای شناسایی الگوهای طبیعی در مقابل نگران ، تجزیه و تحلیل داده های زمان واقعی را تأمین کنند. در عین حال ، این تکنیک های بنیادی نیز در مورد هرگونه داده ای که می توانند احساس غرق و پر سر و صدا کنند ، مانند طبقه بندی یادگیری ماشین یا داده های ناشی از آزمایش های علمی با توان بالا ، اعمال می شوند.
پس از دیدن هر یک از این تکنیک ها در عمل ، شاید دفعه بعد که می خواهید داده های خود را جمع کنید تا بتوانید آن را ساده کنید ، در عوض ممکن است سعی کنید داده های خود را دوباره تنظیم کنید ، تقویت کنید یا تقسیم کنید. داده ها را در متن کامل خود مشاهده کنید تا الگوهای غیر منتظره را فاش کرده و سؤالات جدید محور داده را سوق دهید. پیچیدگی را با (به معنای واقعی کلمه) تغییر دهید که نحوه نگاه به داده های خود را تغییر دهید.
پادکست Overflow Stack یک مکالمه هفتگی در مورد کار در توسعه نرم افزار ، یادگیری کدگذاری و هنر و فرهنگ برنامه نویسی رایانه است.
مربوط

شریک شریک 4 ژانویه 2023 < Span> پس از دیدن هر یک از این تکنیک ها در عمل ، شاید دفعه بعد که می خواهید داده های خود را جمع کنید تا آن را ساده کنید ، در عوض ممکن است سعی کنید داده های خود را دوباره تنظیم کنید ، تقویت کنید یا تقسیم کنیدپس زمینه پیش زمینه. داده ها را در متن کامل خود مشاهده کنید تا الگوهای غیر منتظره را فاش کرده و سؤالات جدید محور داده را سوق دهید. پیچیدگی را با (به معنای واقعی کلمه) تغییر دهید که نحوه نگاه به داده های خود را تغییر دهید.