جمع کردن سیگنال در داده های خود را متوقف کنید

ساخت وبلاگ

با جمع کردن داده های خود در تلاش برای ساده سازی آن ، سیگنال و زمینه ای را که لازم داریم از دست می دهیم تا آنچه را می بینیم ، از دست بدهیم.

به مدت پنج سال به عنوان یک تحلیلگر داده ، درآمد Google را پیش بینی و تجزیه و تحلیل کردم. به مدت شش سال به عنوان یک متخصص تجسم داده ، من به مشتریان و همکاران کمک کردم تا ویژگی های جدیدی از داده هایی را که آنها می شناسند را کشف کنند. بارها و بارها ، فهمیدم که با مشخص تر بودن در مورد آنچه برای ما مهم است و در آغوش پیچیدگی در داده های ما ، می توانیم ویژگی های جدیدی را در آن داده ها کشف کنیم. این ویژگی ها می تواند ما را به سؤال بهتر از داده های محور تبدیل کند که نحوه تجزیه و تحلیل داده های خود ، پارامترهایی را که برای مدل ها ، فرآیندهای علمی ما یا استراتژی های تجاری خود انتخاب می کنیم ، تغییر می دهد.

همکاران من ایان جانسون ، مایک فریمن و من به تازگی در مجموعه ای از داستانهای داده محور درباره مصرف برق در تگزاس و کالیفرنیا همکاری کردیم تا بهترین شیوه های تجزیه و تحلیل داده های سری زمانی را نشان دهیم. ما خودمان را به طور مکرر تغییر دادیم که چگونه داده ها را برای آشکار کردن سیگنال های زیرین به جای اینکه با پیروی از عمل استاندارد جمع آوری داده های ساعتی به روزها ، هفته ها یا ماه ها ، به عنوان سر و صدا رفتار کنیم. در پشت بسیاری از بهترین شیوه هایی که برای تجزیه و تحلیل سری زمانی توصیه کردیم موضوعی عمیق تر بود: در واقع پذیرش پیچیدگی داده ها.

جمع آوری بهترین روش استاندارد برای تجزیه و تحلیل داده های سری زمانی است ، اما می تواند با از بین بردن زمینه مهم ، مشکلاتی را ایجاد کند تا شما حتی از اینکه بینش بالقوه خود را از دست داده اید آگاه نباشید. در این مقاله ، من با بحث در مورد چگونگی جمع آوری مشکل ، قبل از اینکه در سه گزینه دیگر برای جمع آوری با نمونه های قبل/بعد از نمونه هایی که نشان می دهد ، شروع می کنم:

  • تنظیم مجدد داده ها برای مقایسه "دوست داشتن".
  • افزودن داده ها با مفاهیمی که مهم هستند ، مانند "تابستان" در مقابل "زمستان" یا دسته بندی های تعریف شده داده مانند مصرف انرژی "بالا" یا "عادی".
  • با استفاده از داده ها به عنوان زمینه با تقسیم داده ها به "پیش زمینه" و "پیش زمینه" ، بنابراین مجموعه داده های کامل زمینه لازم را برای درک زیر مجموعه خاص داده هایی که به آنها علاقه مند هستیم فراهم می کند.

مشکل تجمیع چیست؟

ما وقتی در مورد الگوریتم ها و ماشین های تدریس صحبت می کنیم ، از اهمیت مجموعه داده های بزرگ و غنی ستایش می کنیم تا از داده ها بیاموزیم. با این حال ، اغلب اوقات وقتی داده ها را تجسم می کنیم تا ما به عنوان انسان بتوانیم از آن استفاده کنیم ، به خصوص داده های سری زمانی ، داده ها را کوچکتر و کوچکتر می کنیم.

تجمع به یک دلیل پیش فرض است. برای رسیدگی به مقادیر داده ای که اکنون در نوک انگشتان خود داریم ، می تواند احساس غافلگیرانه ای داشته باشد. برای داشتن بیش از 1 میلیون امتیاز داده ، بیش از تعداد پیکسل ها در صفحه اصلی لپ تاپ ، لازم نیست "داده های بزرگ" باشد. بسیاری از رویکردهای آماری قوی برای جمع آوری و تجمع مؤثر وجود دارد که می تواند زمینه ارزشمندی را فراهم کند (به عنوان مثال با مقایسه با میانه). در موارد دیگر ، ما باید در حالی که سعی در یافتن بینش کلیدی داریم ، جزئیات بیشتری را ببینیم ، اما پس از اتمام تجزیه و تحلیل و دانستن اینکه کدام ویژگی های داده ها بیشتر است ، پس از آن جمع آوری می تواند ابزاری مفید برای توجه به توجه به ارتباط با آن بینش باشد. واد

اما هر بار که جمع می شوید ، تصمیمی می گیرید که کدام ویژگی های داده خود را مهم می کند و کدام یک از آنها را می خواهید رها کنید: کدام سیگنال هستند و نویز کدام است. وقتی نمودار خط را صاف می کنید ، آیا این کار را انجام می دهید زیرا تصمیم گرفته اید که میانگین روزانه مهمترین است و به توزیع یا تغییر فصلی در ساعات اوج مصرف اهمیت نمی دهید؟یا آیا این کار را انجام می دهید زیرا این تنها راهی است که می دانید چگونه خطوط پیچیده را در نمودار خود قرار دهید؟

تجمع آگاهانه ساده و اولویت بندی می کند. تجمع ناآگاه به این معنی است که شما هرگز نمی دانید چه بینش هایی را از دست داده اید.

در عجله ما برای جمع شدن ، بعضی اوقات فراموش می کنیم که اعداد به چیزهای واقعی گره خورده اند. به اقدامات مردمبه الگوهای ساعتی ، روزانه ، هفتگی ، ماهانه و فصلی که آنقدر آشنا هستند که تقریباً فراموشی هستند. یا شاید اینگونه باشد که ما به ندرت داده های تفکیک شده را به طور مؤثر مشاهده می کنیم که حتی متوجه نمی شویم که این یک گزینه است. با در نظر گرفتن این الگوهای فصلی ، این عوامل انسانی ، ما می توانیم پیچیدگی را به روش های معنی دار تر پذیرایی کنیم.

در نظر بگیرید که چقدر انرژی استفاده می کنیم. اگر لحظه ای در مورد آن فکر کنیم ، بدیهی است که ما در اواخر بعد از ظهر از اوایل صبح از انرژی بیشتری استفاده می کنیم ، بنابراین انتظار داریم هر روز غرق و فرورفتگی های بزرگی کنیم. همچنین نباید جای تعجب داشته باشد که الگوهای روزانه مصرف انرژی در یک روز تابستان و یک روز زمستان متفاوت است. این الگوهای سر و صدا نیستند ، بلکه برای ایجاد این داده ها بسیار مهم هستند. ما به خصوص به این زمینه احتیاج داریم تا آنچه را که انتظار می رود و چه چیزی قابل توجه است بگوییم.

با این حال ، هنگامی که مجموعه داده های ما از روز به روز یا ساعت به ساعت نوسانات بزرگ و منظم دارد ، نمودارهای خط ما به نظر می رسد مانند یک آشفتگی قریب به اتفاق خطوط مبهم. این نمودار را در نظر بگیرید که 8،760 نقطه داده را نشان می دهد که یک سال داده در مورد مصرف انرژی ساعتی در کالیفرنیا را نشان می دهد.

یک روش استاندارد برای مقابله با این نمودار قریب به اتفاق استفاده از میانگین در روز ، هفته یا ماه است (به عنوان یک دوره چهار هفته تعریف شده است).

بله ، اکنون ما یک نمودار ساده داریم و به راحتی می توانیم ببینیم که کمترین مصرف انرژی در ماه آوریل و اوج اواخر ماه اوت است. اما ما می توانیم این را در نمودار اول ببینیم. علاوه بر این ، ما هر چیز مورد علاقه دیگری را صاف کرده ایم. ما آنقدر اطلاعات را دور انداختیم که حتی نمی دانیم چه چیزی را از دست داده ایم.

آیا این الگوی سالانه با افت در ماه آوریل و اوج در ماه اوت ، برای تمام ساعات روز سازگار است؟آیا برخی از ساعات روز یا روزهای هفته بیشتر از سایر فصل ها تغییر می کند؟آیا ساعت ها ، روزها یا هفته هایی وجود داشت که برای زمان سال/زمان روزشان غیر معمول بود؟Outliers چیست؟آیا مصرف انرژی در تمام زمان های سال به همان اندازه متغیر است ، یا برخی از هفته ها/فصول/ساعت ها از سایرین سازگار هستند؟

با وجود شروع با داده هایی که باید حاوی پاسخ این سؤالات باشد ، ما نمی توانیم به آنها پاسخ دهیم. علاوه بر این ، خط صاف حتی هیچ گونه نکاتی را در مورد سؤالاتی که باید بپرسید یا چه چیزی ارزش حفر بیشتر را دارد ، به ما نمی دهد.

راه حل: با تنظیم مجدد ، تقویت و استفاده از داده ها برای ارائه زمینه ، پیچیدگی را در آغوش بگیرید.

شماره 1: جمع نکنید: تنظیم مجدد

چه می شود اگر ما در نظر بگیریم که چه دسته هایی براساس آنچه از رفتار انسان و عوامل محیطی ، به ویژه دما می دانیم مهم است؟عواملی مانند زمان روز و زمان سال؟در کشف الگوهای داده ، ما داده ها را به 96 نمودار کنه کوچک و تراز شده ، یکی برای هر ساعت از روز برای هر فصل از سال گروه بندی کردیم و تجسم پیرامون مفاهیم را که به احتمال زیاد اهمیت دارند ، ترتیب دادیم. محور x برای هر نمودار مینی مقدار برق مورد استفاده است و هر علامت تیک یک روز یک ساعت را در یک روز خاص نشان می دهد.

به این ترتیب ما می توانیم بلافاصله برای هر ساعت و چهارم آنچه معمولی یا غیرمعمول است را ببینیم. به عنوان مثال ، به طور کلی انرژی بیشتری در نیمه شب در زمستان از 3 صبح استفاده می شود. با پایین آمدن یک ستون ، می توانیم شکل یک روز را برای هر فصل مشاهده کنیم. و ، می توانیم ببینیم که چگونه تقاضای انرژی در ساعت در فصول با مقایسه هر ستون با قسمت بعدی تغییر می کند.

اکنون "سر و صدا" به سیگنال تبدیل شده است. ما به وضوح می توانیم به سؤالاتی که در بالا مطرح کردیم پاسخ دهیم:

  • آیا این الگوی سالانه برای تمام ساعات روز سازگار است؟
    • نه ، "شکل" انرژی مورد استفاده در طول روز در زمستان در مقابل تابستان متفاوت است ، با یک قله دوتایی در Q1 و یک قله واحد در Q3. همچنین ، Q4 بسیار شبیه Q1 است ، به جز چند روز غیرمعمول. و Q2 بیشترین تنوع را در "شکل" روز نشان می دهد.
    • آیا برخی از ساعات روز یا روزهای هفته بیشتر از ساعات دیگر در طول فصول تغییر می کند؟
      • بله ، ساعات اواخر بعد از ظهر و عصر بسیار بیشتر از افزایش مصرف انرژی از Q1 به Q3 نسبت به ساعات اولیه صبح نشان می دهد.
      • آیا ساعت ها ، روزها یا هفته هایی وجود داشت که برای زمان سال/زمان روزشان غیر معمول بود؟
        • آره. به عنوان مثال ، در Q4 برخی از روزهای بسیار غیرمعمول در عصر ، مصرف انرژی بالایی را مشاهده می کردند.
        • آره. در Q3 در ساعات اولیه صبح (بین 4 صبح تا 6 صبح) ، روزهای دوتایی با مصرف انرژی بسیار بالاتر وجود داشت.
        • آیا مصرف انرژی در تمام زمان های سال به همان اندازه متغیر است ، یا برخی از هفته ها/فصول/ساعت ها از سایرین سازگار هستند؟
          • نه! Q1 از انرژی بسیار سازگارتر برخوردار است و دارای طیف بسیار باریک انرژی مورد استفاده برای هر ساعت خاص از روز است. در همین حال ، Q2 میزان مصرف انرژی بسیار متناقض را نشان می دهد ، با تنوع زیادی به خصوص در ساعات عصر عصر با انرژی بالاتر.

          نه تنها بلافاصله متوجه برخی الگوهای می شویم ، بلکه این دیدگاه از داده ها نیز به ما این فرصت را می دهد که فقط با نگاه دقیق تر (و انجام برخی تحقیقات اساسی در مورد آنچه در آن زمان در کالیفرنیا اتفاق می افتد) عمیق تر شویم.

          بیایید در ساعات اولیه صبح Q3 نزدیکتر باشیم. مقادیر غیر طبیعی بالایی بین 4 بعد از ظهر و 6 بعد از ظهر وجود دارد. ابزارهای تعاملی نشان می دهد که این موارد در 19 اوت اتفاق افتاد. جستجوی سریع گوگل برای "کالیفرنیا 19 اوت 2020" نشان می دهد که این منطقه از آتش سوزی رنج می برد ، بنابراین شاید مردم به جای باز کردن پنجره های خود به شب خنک تر ، ویندوز را بسته و AC نگه داشته باشند. هوا. 6 سپتامبر همچنین در بین بالاترین ارزش ها نشان می دهد ، و یک جستجو علت احتمالی را نشان می دهد: یک موج گرمای رکورددار در کالیفرنیا که در حالی که آتش سوزی ها به سوختند ، به اخبار ملی رسید.

          به طور کلی ، نمودار ماپ تیک تیک تیک تیک تیک همان تعداد داده های خط اصلی را دارد ، اما اکنون می توانیم الگوهای روزانه و فصلی را مشاهده کنیم (و الگوهای روزانه در فصلی متفاوت است) و همچنین مساحت نسبی. هرچه زمان بیشتری را با نمودار بگذرانیم ، بیشتر متوجه می شویم ، زیرا ما را دعوت می کند تا سؤالات جدید محور داده را بپرسیم.

          2: ابتدا تقویت ، سپس گروه یا رنگ

          دانش مشترک را بیاورید: تقویت با طبقه بندی های آشنا

          در یک نقطه دیگر از تجزیه و تحلیل اکتشافی ما ، ما به نمودار نگاه کردیم که 52 هفته مصرف انرژی ساعتی در کالیفرنیا (نشان داده شده در بالا) را نشان داد و متوجه شدیم که هفته های انرژی بالاتر هر روز یک برآمدگی واحد در عصر در حالی که هفته های کم مصرف است ، به نظر می رسدبه نظر می رسید که بیشتر از یک دست انداز مضاعف برخوردار است (به بالا مراجعه کنید). این در واقع همان الگویی است که در بخش شماره 1 در تنظیم مجدد نشان داده شده است.

          ما حدس زدیم که ممکن است دست انداز/دوتایی منفرد با اختلافات فصلی در دما باشد. برای آزمایش این فرضیه ، یک ستون به مجموعه داده ها اضافه کردیم تا "تابستان" در مقابل "زمستان" را تعیین کنیم و سپس با تقسیم داده ها بر روی آن پارامتر ، دو نمودار (FaceTed) درست کردیم. ناگهان واضح بود. دیگر ما در تلاش نبودیم تا متوجه الگویی که در چاله ها پنهان شده بود ، متوجه شویم.

          خود "جنبه" ساده بود ، ویژگی ای که در بسیاری از API های نمودار از جمله طرح قابل مشاهده (که ما برای تجسم داده های خود استفاده می کردیم) ساخته شده است. در ضمن ، این به نظر می رسد یک روش آشکار برای تقسیم داده ها است. اما چند بار ما به عقب برگردیم و در واقع داده های خود را با این مفاهیم مرتبط با انسان تقویت می کنیم؟نکته اصلی داشتن پارامتر تابستان/زمستان برای Facet بود.

          لازم نیست کامل باشد. حدس زدن در مرز تاریخ برای تابستان/زمستان کافی است تا ببینیم الگوی مشخصی پدیدار می شود. هنگامی که ما بینش دو ضربه ای/تک ضربه ای را در اینجا قابل مشاهده داریم ، می توانیم از این بینش استفاده کنیم تا به عقب برگردیم و داده های خود را از نزدیک نگاه کنیم. به عنوان مثال ، به نظر می رسد که هفته های روزانه "دوتایی" در "تابستان" وجود دارد. آیا آن هفته های مرزی که باید به عنوان زمستان (یا پاییز یا بهار) طبقه بندی شوند؟یا آیا آنها هفته های غیرمعمول در طول تابستان هستند؟علاوه بر این ، اکنون که ما یک سیگنال تعیین کننده را می شناسیم ، می توانیم از آن سیگنال برای طبقه بندی داده ها استفاده کنیم و از این طریق از داده ها استفاده کنیم تا هنگام انتقال مصرف انرژی از الگوی "تابستان" به الگوی "زمستان" شناسایی شود.

          تقویت با طبقه بندی داده های محور

          این نمودار خط استفاده روزانه انرژی توسط یک خانواده واحد در آتلانتا از مارس تا ژوئیه 2021 را نشان می دهد. بسیاری از سنبله ها؟مصرف انرژی بالاتر در ماه های تابستان؟

          جابجایی به یک پراکندگی باعث می شود که روزهای انرژی عادی و همچنین روزهای پر انرژی وجود داشته باشد. ترسیم در یک خط برای میانگین متحرک به علاوه A بافر (5 کیلووات ساعت) این شکاف را بین روزهای "عادی" و "انرژی بالا" روشن تر می کند و نشان می دهد که این شکاف حتی با افزایش کل مصرف انرژی در ماه های تابستان حفظ می شود.

          اکنون که تجزیه و تحلیل داده های اکتشافی ما دو دسته مجزا (طبیعی و پر انرژی) را نشان داده است ، می توانیم با استفاده از میانگین متحرک ، داده های خود را تقویت کنیم تا تعریف کنیم که کدام نقاط در هر گروه قرار می گیرند. سپس می توانیم نقاط را با آن طبقه بندی های جدید رنگ کنیم تا تجزیه و تحلیل آسان تر شود.

          به این ترتیب ، ما دایره را تکمیل می کنیم: ما از تجسم استفاده می کنیم تا به یک ویژگی اصلی داده ها توجه کنیم و از این بینش استفاده کنیم تا داده های خود را طبقه بندی کنیم و تجسم را آسانتر می کنیم. و ما می توانیم آن را یک قدم جلوتر برداریم و با ایجاد یک هیستوگرام که نشان دهنده فراوانی با انرژی بالا در مقابل روزهای استفاده عادی در ماه است ، به تجزیه و تحلیل داده های خود بر اساس این طبقه بندی ادامه دهیم. در این دیدگاه ، می بینیم که در تابستان میزان انرژی مورد استفاده در روزهای عادی بالا می رود و روزهای پر انرژی در ماه ژوئن و ژوئیه نسبت به مارس و آوریل وجود داشت (حتی پس از در نظر گرفتن آن که انرژی پایهاستفاده نیز بالا رفت). بنابراین ، اکنون می توانیم با اطمینان بگوییم که مصرف انرژی کلی به دو دلیل افزایش یافته است: (1) استفاده از انرژی پایه افزایش یافته و (2) درصد بالاتری از روزها روزهای پر انرژی بود.

          این الگوی نگاه کردن ، سپس تقویت ، سپس با استفاده از طبقه بندی دوباره می تواند هرگونه مسئله در طبقه بندی ما را نشان دهد ، مانند نقطه ای که در روز ششم داده های ما رخ داده است که گمراه شده است زیرا میانگین متحرک تا روز هفتم تعریف نشده است (به عنوان یک میانگین متحرک در حال حرکت). این به ما فرصتی می دهد تا الگوریتم طبقه بندی خود را بهبود بخشیم.

          در حالی که این مثال از یک الگوریتم بسیار ساده از "حرکت متوسط + 5kwh" برای طبقه بندی روزها به عنوان "عادی" یا "انرژی بالا" استفاده کرده است ، این چرخه "نگاه ، تقویت ، نگاه کردن ، طبقه بندی پالایش" برای یادگیری ماشین به عنوان ما مهمتر می شودالگوریتم ها مات تر می شوند.

          3: داده های خود را به پیش زمینه و پس زمینه تقسیم کنید

          بر اساس یک دوره زمانی مورد علاقه تقسیم شود

          ما همچنین به داده های مربوط به انرژی تولید شده توسط نوع سوخت در تگزاس در ژانویه و فوریه سال 2021 ، از جمله یک دوره زمانی مهم در ماه فوریه منتهی به و در هنگام خاموشی های نورد که برای نجات شبکه برق از فروپاشی پس از طوفان غیرمعمول زمستانی آغاز شده است ، حفر کردیم. واددر داستان تجزیه و تحلیل ، همکار من ایان داده ها را جلوه داد و برای هر نوع سوخت نمودار ایجاد کرد. این کاملاً مؤثر بود: شما می توانید فوراً ببینید که کدام سوخت ها بخش عمده ای از انرژی را در تگزاس و همچنین برخی از الگوهای غیر طبیعی در اواسط فوریه تشکیل می دهند.

          با دانستن اینکه دوره زمانی بحرانی در حدود 7 فوریه تا 21 فوریه بود ، ایان با ساختن هفته های قبل و بعد از تا حدی شفاف و اضافه کردن شبکه های عمودی ، بیشتر به آن دو هفته توجه کرد. او ممکن است وسوسه شده باشد تا داده ها را خارج از دوره حذف کند. از این گذشته ، چرا فضای خارج از مدت زمان مورد علاقه ، فضای داده را در داده ها هدر می دهد؟

          اما این داده های پس زمینه گرانول است که به ما کمک می کند تا در دوره زمانی بحرانی چه چیزی برای هر نوع سوخت غیر معمول باشد. به عنوان مثال ، در ذغال سنگ ما بعد از 15 فوریه بدون در نظر گرفتن ، متوجه می شویم ، اما ما از ژانویه به داده ها نیاز داریم تا متوجه شویم که فلات تقریباً مسطح بین 1 فوریه و 15 فوریه چقدر غیر معمول است. به همین ترتیب ، داده های ژانویه و اواخر فوریه برای هسته ای نشان می دهد که این منبع سوخت به طور معمول چقدر ثابت است و به ما کمک می کند تا درک کنیم که شیب که بعد از 15 فوریه می بینیم چقدر عجیب است.

          تقسیم با مقایسه هر دسته از علاقه ها با مجموعه داده های کامل

          وقتی می خواهیم بدانیم بین متریک A و متریک B رابطه وجود دارد ، اولین قدم ایجاد یک پراکندگی است. به عنوان مثال ، ScatterPlot زیر دمای فضای باز و تقاضای انرژی در تگزاس را برای هر ساعت در طی یک سال نشان می دهد. بلافاصله روشن است که بین دما و مصرف انرژی رابطه محکمی وجود دارد (حتی اگر این رابطه نیز به وضوح غیر خطی باشد!).

          در حالی که به وضوح بین دما و تقاضای برق همبستگی وجود دارد ، همچنین مشخص است که دما کل داستان را نمی گوید. برای هر دمای معین ، اختلاف تقریباً 10-15 کیلو وات ساعت از حداقل تا حداکثر مصرف انرژی وجود دارد. با دانستن اینکه در خانه های خودمان در یک بعد از ظهر سرد ترموستات را بیشتر از یک شب سرد می کنیم ، حدس می زنیم که ساعت روز می تواند نقش اساسی در رابطه بین دما و مصرف انرژی داشته باشد.

          رویکرد استاندارد برای افزودن یک دسته اضافی به یک پراکندگی ، استفاده از یک رنگ طبقه بندی شده است ، در نتیجه همه چیز را با همه چیز مقایسه می کند (مقایسه همه ساعت ها ، دما و تقاضای انرژی در یک نمودار). اگر این کار را انجام دهیم ، می بینیم که چیزی در جریان است. سبزیجات و بلوز بیشتر در بالا سمت راست ، پین های بیشتر کم است. اما برای فهمیدن رنگها به چه مواردی ، باید بین افسانه و داده ها به عقب و جلو نگاه کنید. علاوه بر این ، پاسخ دادن به سوالی مانند "رابطه دما و انرژی در ساعت 10 صبح چیست؟"یا ، "صبح زود چگونه با عصر مقایسه می شود؟

          در عوض می توانیم دو تکنیک را اعمال کنیم: گروه بندی و تقسیم داده ها به پیش زمینه و پس زمینه.

          در سه نمودار زیر ، نقاط نمایانگر 5 صبح ، 10 صبح و 6 بعد از ظهر به رنگ روشن هستند. در همین حال ، کل مجموعه داده ها در پس زمینه به رنگ خاکستری نشان داده شده است. این امر به ما این زمینه را می دهد تا رابطه بین دما و انرژی را برای هر ساعت ببینیم و ببینیم که در متن مجموعه داده های کامل.

          با مقایسه خاص "5 صبح" با "سایر ساعات دیگر روز" ، می توانیم ببینیم که 5 صبح بدون در نظر گرفتن دما ، مصرف انرژی نسبتاً کم است (و درجه حرارت هرگز در 5 صبح خیلی زیاد نیست). در ضمن ، در 6 بعد از ظهر مصرف انرژی به طور کلی در تمام دما بیشتر است.

          10 صبح از بعضی جهات جالب ترین است: در دماهای پایین تر (در نیمه سمت چپ نمودار) نقاط زرد در مقایسه با نقاط خاکستری نسبتاً زیاد هستند ، که نشانگر مصرف انرژی زیاد نسبت به ساعات دیگر روز در همان دما است. در همین حال ، برای دمای زیاد در نیمه سمت راست نمودار ، نقاط زرد در قسمت زیرین خاکستری را در آغوش می گیرند. در دمای گرم ، انرژی نسبتاً کمی در 10 صبح در مقایسه با بقیه روز استفاده می شود. این نوع بینش نه تنها با گروه بندی ، بلکه با استفاده از مجموعه داده کامل "پر سر و صدا" به عنوان یک پس زمینه سازگار فراهم می شود که زمینه ای را برای همه نمودارهای صورت فراهم می کند.

          خلاصه: پیچیدگی داده های خود را در آغوش بگیرید

          در جریان ایجاد جمع آوری داده های سری زمانی تجزیه و تحلیل ، یان جانسون ، مایک فریمن و من از طیف وسیعی از استراتژی ها استفاده کردیم تا به جای تکیه بر روشهای استاندارد که آن را از بین می برد ، پیچیدگی داده ها را در آغوش بگیریم. آن خطوط ناامیدکننده سیگنال هستند ، نه سر و صدا.

          ما پیچیدگی را در آغوش گرفتیم:

          • تنظیم مجدد داده ها برای مقایسه "دوست داشتن".
          • افزایش داده های ما بر اساس مفاهیمی که ما می دانیم مهم و در مورد آنچه در داده ها کشف کردیم.
          • با استفاده از مجموعه داده بزرگتر برای ارائه زمینه پس زمینه برای داده های مورد علاقه (پیش زمینه).

          این رویکردها به ویژه برای داده های سری زمانی قدرتمند هستند زیرا الگوهای زیرزمینی روزانه ، هفتگی و فصلی می توانند احساس حواس پرتی کنند. به طور خاص ، در نظر بگیرید که چگونه این استراتژی ها می توانند با قرار دادن داده های ورودی در یک زمینه تاریخی غنی تر برای تطبیق سریع الگوی بصری برای شناسایی الگوهای طبیعی در مقابل نگران ، تجزیه و تحلیل داده های زمان واقعی را تأمین کنند. در عین حال ، این تکنیک های بنیادی نیز در مورد هرگونه داده ای که می توانند احساس غرق و پر سر و صدا کنند ، مانند طبقه بندی یادگیری ماشین یا داده های ناشی از آزمایش های علمی با توان بالا ، اعمال می شوند.

          پس از دیدن هر یک از این تکنیک ها در عمل ، شاید دفعه بعد که می خواهید داده های خود را جمع کنید تا بتوانید آن را ساده کنید ، در عوض ممکن است سعی کنید داده های خود را دوباره تنظیم کنید ، تقویت کنید یا تقسیم کنید. داده ها را در متن کامل خود مشاهده کنید تا الگوهای غیر منتظره را فاش کرده و سؤالات جدید محور داده را سوق دهید. پیچیدگی را با (به معنای واقعی کلمه) تغییر دهید که نحوه نگاه به داده های خود را تغییر دهید.

          پادکست Overflow Stack یک مکالمه هفتگی در مورد کار در توسعه نرم افزار ، یادگیری کدگذاری و هنر و فرهنگ برنامه نویسی رایانه است.

          مربوط

          شریک شریک 4 ژانویه 2023 < Span> پس از دیدن هر یک از این تکنیک ها در عمل ، شاید دفعه بعد که می خواهید داده های خود را جمع کنید تا آن را ساده کنید ، در عوض ممکن است سعی کنید داده های خود را دوباره تنظیم کنید ، تقویت کنید یا تقسیم کنیدپس زمینه پیش زمینه. داده ها را در متن کامل خود مشاهده کنید تا الگوهای غیر منتظره را فاش کرده و سؤالات جدید محور داده را سوق دهید. پیچیدگی را با (به معنای واقعی کلمه) تغییر دهید که نحوه نگاه به داده های خود را تغییر دهید.

کسب درآمد از فارکس...
ما را در سایت کسب درآمد از فارکس دنبال می کنید

برچسب : نویسنده : عسلی سهیال بازدید : <-PostHit-> تاريخ : سه شنبه 26 ارديبهشت 1402 ساعت: 13:45