تجزیه و تحلیل همبستگی بازار مالی و برنامه انتخاب سهام بر اساس خوشه بندی TCN- عمیق

ساخت وبلاگ

تجزیه و تحلیل همبستگی بازار برای انتخاب سهام در زمینه سرمایه گذاری مالی معنی دار است. از آنجا که برای روشهای خوشه بندی عمیق موجود برای استخراج ویژگی های پیچیده و غیرخطی موجود در سری زمانی مالی دشوار است ، تا بتواند از ویژگی های سریال زمانی مالی و دستیابی به خوشه بندی عمیق استفاده کند ، یک روش جدید خوشه بندی عمیق پایان به پایان برای زمان مالیسریال پیشنهاد شده است. این شامل دو ماژول است: یک شبکه استخراج ویژگی AutoEncoder مبتنی بر شبکه های TCN (عصبی موقت) و یک الگوریتم بهینه سازی خوشه بندی زمانی با واگرایی KL (Kullbac k-Liibler). ویژگی های سری زمانی مالی با حل و فصل علی و حل و فصل گشاد شبکه های TCN نشان داده شده است. سپس ، نتایج قبل از آموزش بر اساس واگرایی KL به خوبی تنظیم می شود تا نتایج خوشه بندی تبعیض آمیز باشد. نتایج تجربی نشان می دهد که روش پیشنهادی از الگوریتم های خوشه بندی عمیق و خوشه بندی عمومی موجود در بازارهای شاخص CSI 300 و S& P 500 فراتر می رود. علاوه بر این ، نتایج خوشه بندی همراه با یک استراتژی استنتاج می تواند برای انتخاب سهام هایی که عملکرد خوبی یا ضعیف دارند ، استفاده شود ، بنابراین معاملات واقعی بازار سهام را هدایت می کند.

1. معرفی

در زمینه سرمایه گذاری مالی ، سرمایه گذاران می خواهند از بازار سهام پر سر و صدا و نامشخص سود ببرند. بیشتر مطالعات در حال حاضر بر پیش بینی قیمت یک سهام واحد یا طبقه بندی روند آن متمرکز است [1،2،3]. با این حال ، مطالعات موجود نشان داده است که حتی با استفاده از مدل های پیش بینی با دقت بالا ، به دست آوردن بازده عینی در محیط های بازار واقعی دشوار است [4،5]. در نتیجه ، سرمایه گذاران اغلب به دنبال تنوع بخشیدن به اوراق بهادار خود برای جلوگیری از خسارات بزرگ حوادث سیاه سوان هستند. روشهای فعلی برای تجزیه و تحلیل همبستگی سهام به طور عمده پیوند پیچیده سهام از طریق قوانین انجمن ، تجزیه و تحلیل عاملی ، شبکه های پیچیده و غیره را معدن می کند [6]. به عنوان مثال ، در زمینه اقتصاد ، Dimitrios و همکاران.[7] از تحول مداوم موجک (CWT) برای تجزیه و تحلیل اثرات سرریز همبستگی استفاده کرد ، که فرض می کند سهام در یک صنعت یکسان بسیار همبسته هستند و ممکن است اثرات بین صنایع مختلف نادیده گرفته شود. با این حال ، رویکرد کلی برای داده کاوی نیاز به درجه ای از صلاحیت در زمینه مالی دارد. الگوریتم های خوشه بندی نتایج بسیار خوبی برای داده های بدون دانش قبلی دارند ، بنابراین این مطالعه بر کاربرد الگوریتم های خوشه بندی با همبستگی سری زمانی مالی متمرکز است.

هدف کلی تجزیه و تحلیل خوشه بندی طبقه بندی مجموعه ای از اشیاء به گروه هایی است که شبیه به یکدیگر هستند و این یک ابزار مفید برای تجزیه و تحلیل داده های اکتشافی در زمینه های مختلف علم و صنعت است [8]. در روزهای ابتدایی ، روشهای یادگیری ماشین بر اساس مدل های K ، K-شکل یا مدل های طیفی می توانند ویژگی های داده را استخراج کرده و آنها را طبقه بندی کنند. با این وجود ، اطمینان از اینكه ویژگی های استخراج شده توسط چنین روشهایی متناسب با ساختار خوشه بندی داده ها هستند ، دشوار است زیرا نتایج خوشه بندی به نحوه نمایش داده ها بستگی دارد. تحقیقات فعلی در مورد الگوریتم های شبکه خوشه بندی در امور مالی بر روشهای اقدامات همبستگی برای مدلهای خوشه بندی [9] متمرکز است و این روش خوشه بندی نیز خوشه بندی کاربردی نامیده می شود. خوشه بندی عملکردی با هدف بردار داده های اصلی در فضا با یک معیار مناسب [10،11،12]. سان و همکاران.[13] یک اندازه گیری شباهت جدید را بر اساس جبران تعصب نقطه شدید برای اندازه گیری شباهت های قیمت ترکیبات SSE 50 ارائه داد. با این حال ، این نوع متریک پیچیده است و در سایر حوزه های داده قابل استفاده نیست.

در سالهای اخیر ، یادگیری عمیق به دلیل استخراج ویژگی های قدرتمند خود ، توجه زیادی به ترکیب خود با کارهای خوشه ای جلب کرده است ، و قابلیت های نمایندگی و چنین روش هایی نیز خوشه بندی عمیق نامیده می شود [14]. خوشه بندی عمیق مستلزم آن است که داده های استخراج شده نمایندگی کم بعدی مناسب برای خوشه بندی را در حالی که ویژگی های اطلاعات و ویژگی های ساختاری داده های اصلی را منعکس می کند ، برآورده کند [15]. روشهای خوشه بندی عمیق پیشرفت زیادی در زمینه دید رایانه داشته است [16،17] ؛با این حال ، برای کارهای سری زمانی بدون نظارت ، پتانسیل آنها به طور کامل مورد سوء استفاده قرار نگرفته است.

دسامبر [18] و IDEC [19] معماری های جدید فعلی برای یادگیری عمیق بدون نظارت هستند. این مدل ها ابتدا داده های اصلی را از طریق یک بردار شبکه عصبی نشان می دهند و از طریق این بازنمایی ، مدل ها توزیع کلاس خوشه بندی داده ها را استنباط می کنند. به عنوان مثال ، در دسامبر ، مجموعه ای از ورودی های خام توسط یک Perceptron چند لایه (MLP) برای به دست آوردن یک بردار پنهان نشان داده شده است که به طور تکراری ضرر خوشه بندی را با کمک یک هدف کمکی خودآموز بهینه می کند. IDEC یک اصطلاح بازسازی را به عملکرد DEC از دست دادن برای حفظ خصوصیات فضای ویژگی اضافه می کند. لی و همکاران.[20] DBC را پیشنهاد کرد ، که جایگزین شبکه از پیش آموزش در دسامبر با CNN برای استخراج ویژگی های با کیفیت بالا حاوی اطلاعات فضایی پیکسل و بهبود عملکرد کلی خوشه بندی می شود. اگرچه روشهای فوق به طور قابل توجهی عملکرد خوشه بندی را بهبود می بخشد ، در زمینه مالی ، روند سهام مختلف به طور گسترده ای متفاوت است و ضبط هر سهام برای ضبط دشوار است [21]. اتخاذ روشهای مناسب توصیف به یک چالش تبدیل شده است. شبکه های عصبی توطئه ای (TCN) [22] توسط بای و همکاران پیشنهاد شد. و در حال حاضر در بسیاری از کارها که شامل مدل سازی پی در پی مانند تشخیص گفتار ، ترجمه ماشین و غیره است ، آنها ویژگی های شبکه های عصبی مکرر (RNN) را ترکیب می کنند ، که می توانند اطلاعات تاریخی معنی دار و شبکه های عصبی حلقوی (CNN) را بیاموزند ، که عبارتند ازاز نظر محاسباتی کارآمد است ، بنابراین پردازش مدل سازی دنباله را با سرعت آموزش پیشرفته در حالی که ویژگی های زمانی کامل را حفظ می کند ، امکان پذیر می کند. این مقاله شبکه های TCN را با شبکه های AutoEncoder ترکیب می کند و یک الگوریتم خوشه بندی زمانی عمیق به نام خوشه بندی Deep TCN را پیشنهاد می کند.

بقیه این مقاله از موارد زیر تشکیل شده است: بخش 2 بر روی مدل خوشه بندی زمانی AutoEncoder بر اساس شبکه های عصبی حلقوی زمانی متمرکز است. بخش 3 در تنظیمات پارامتر آزمایش و تجزیه و تحلیل نتایج تجربی متمرکز است. بخش 4 با در نظر گرفتن یک استراتژی استنتاج ، عملکرد بازگشت را تأیید می کند. بخش 5 مطالعه را نتیجه می گیرد و پیشنهاداتی را برای سایر حوزه ها ارائه می دهد.

2. شبکه خوشه بندی عمیق سری مالی: خوشه بندی عمیق TCN

برای پرداختن به مشکلاتی که روشهای خوشه بندی عمومی نمی تواند تضمین کند که ویژگی های استخراج شده متناسب با ساختار خوشه بندی و الگوریتم های خوشه بندی عمیق فعلی نمی توانند ویژگی های سری زمانی مالی را ضبط کنند ، یک الگوریتم خوشه بندی عمیق پایان برای سری زمانی مالی ارائه شده است. معماری خوشه بندی عمیق TCN از سه مؤلفه اصلی تشکیل شده است: یک رمزگذار ، رمزگشایی و لایه خوشه بندی زمانی ، همانطور که در شکل 1 نشان داده شده است. در مرحله اول ، یک شبکه استخراج ویژگی متشکل از یک خودکار مبتنی بر یک شبکه TCN پیش از این استآموزش دیده و در مرحله دوم ، لایه خوشه بندی زمانی برای تنظیم دقیق ویژگی پنهان اضافه می شود. جزئیات این الگوریتم به شرح زیر است.

2. 1شبکه AutoEncoder TCN

این مقاله برای استخراج ویژگی های سری زمانی مالی ، یک AutoEncoder را بر اساس یک شبکه TCN طراحی می کند. شبکه TCN دو عمل را در مقایسه با 1D CNN اضافه می کند: پیچش های گاه به گاه و گشاد شده و اتصال در سطح شبکه با یک شبکه باقیمانده ، همانطور که در شکل 2 نشان داده شده است. عملکرد فعال سازی) ، و لایه های وزنه برداری و ترکیبی نیز برای منظم کردن شبکه در هر لایه اضافه می شوند تا از ناپدید شدن شیب ناشی از فرایند آموزش جلوگیری شود. بر خلاف CNN 1D کاملاً متصل که در شکل 3A نشان داده شده است ، Convolution علیت در نظر گرفته می شود که سری زمانی فقط باید تحت تأثیر وضعیت فعلی یا حالت گذشته باشد ، همانطور که در شکل 3B نشان داده شده است. برای حل مشکل میدان پذیرنده محدود شبکه های حلقوی علی ، یک شبکه TCN یک حل و فصل گشاد را مطرح می کند. برای یک سری زمانی ورودی یک بعدی x = x 1 ، x 2 ،.، x t ، f:<0 , 1 , 2 , … k − 1>نمایانگر یک هسته Convolution است. حلقوی گشاد شده در x t با معادله (1) محاسبه می شود:

جایی که K نشان دهنده اندازه هسته حلقوی است ، D فاکتور اتساع را نشان می دهد ، و t - d · i نشان دهنده جهت گذشته است. به عنوان مثال ، هنگامی که d = 1 ، k = 2 ، x t عملکرد حلقوی را فقط با x t - 1 انجام می دهد. شکل 4 ساختار شبکه TCN را با هسته حلقوی K = 2 و یک فاکتور اتساع D = [1 ، 2 ، 4 ، 8] ارائه می دهد. همانطور که در شکل 4 نشان داده شده است ، لایه سوم از راست ترین عنصر می تواند هشت عنصر ورودی را دریافت کند. بدون پیچیدگی گشاد ، دریافت ورودی به همان طول باعث می شود تعداد لایه های موجود در شبکه به هشت نفر برسد ، که منجر به افزایش چشمگیر در تعداد پارامترهای آموزش داده می شود.

2. 2روند آموزش

از دست دادن کل خوشه بندی های عمیق TCN شامل مجموع تلفات دو مؤلفه است: از دست دادن بازسازی و از دست دادن واگرایی KL ، همانطور که در معادله (10) نشان داده شده است ، که از نظر دو استخراج ویژگی زمانی و زمان ارائه شده استبهینه سازی خوشه بندی سری.

2. 2. 1. استخراج ویژگی های سری زمانی

فرض کنید x = x 1 ، x 2 ،… ، x t سری اصلی سهام ورودی است. ابتدا ، فرآیند رمزگذاری f را انجام دهید ، همانطور که در شکل 1 نشان داده شده است. هدف نمایش مشخصه داده های اصلی است ، عبارات آن معادلات (3) و (4) است ، جایی که σ f نشان دهنده عملکرد عملکرد فعال سازی درفرآیند رمزگذاری و عملکرد فعال سازی مورد استفاده در اینجا RELU است. W و B 1 نشان دهنده وزن هسته و تعصب فرآیند رمزگذار است.

فرآیند رمزگشایی G ، همانطور که در قسمت سمت راست شکل 1 نشان داده شده است ، هدف از بازسازی ویژگی ها به عنوان نمایش مشابه داده های اصلی است ، جایی که σ g عملکرد فعال سازی فرآیند تجزیه و W ′ و B 2 است. وزن و تعصبات هسته به ترتیب در فرآیند رمزگشایی.

AutoEncoder یک الگوریتم یادگیری بدون نظارت است که در آن عملکرد از دست دادن به طور مداوم پارامترهای AutoEncoder را در طی فرایند آموزش تنظیم می کند. این L R را به حداقل می رساند تا X ′ را نزدیک به X ، که ویژگی زمانی z i را استخراج می کند ، به حداقل برساند. از دست دادن بازسازی در معادله (7) نشان داده شده است:

2. 2. 2. بهینه سازی خوشه بندی سری زمانی

پس از اتمام مرحله اولیه استخراج ویژگی TCN AutoEncoder ، شبکه رمزگشایی AutoEncoder برداشته می شود و فقط قسمت رمزگذار استخراج ویژگی حفظ می شود و لایه خوشه بندی بر این اساس سفارشی می شود. از ویژگی زمانی Z I که توسط رمزگذار به عنوان ورودی استخراج شده و نتایج خوشه بندی سهام را از طریق اندازه گیری شباهت (فاصله اقلیدسی) بدست آورید. با توجه به تعداد بهینه خوشه های K تعریف شده در مرحله اولیه ، مراکز خوشه K به دست می آیند. مرکز کلاس خوشه I-th μ i است.

K-Means سنتی از رویکرد برچسب زدن سخت برای اندازه گیری شباهت نقاط نمونه به مراکز خوشه ای استفاده می کند اما نمی تواند عدم اطمینان داده ها را به مراکز خوشه اندازه گیری کند ، به خصوص اگر نقاط دوتایی با دقت کم اختصاص داده شوند ، که ممکن است کیفیت را کاهش دهدخوشه بندیبنابراین ، در این مقاله ، از توزیع T برچسب های نرم برای اندازه گیری شباهت بین نقاط نمونه و مراکز خوشه بندی استفاده می شود ، همانطور که در معادله نشان داده شده است (8):

جایی که z j - μ i 2 فاصله از z j تا مرکز خوشه μ μ i است. q i j احتمال طبقه بندی q i j به مرکز خوشه بندی μ i است. α درجه آزادی توزیع T است ، که برای بهبود کیفیت خوشه بندی تنظیم شده است ، این مدل توزیع احتمال هدف اعتماد به نفس بالا را بر اساس مرکز خوشه بندی تعریف می کند ، همانطور که در معادله نشان داده شده است (9). P I J احتمال اینکه Z J به مراکز مختلف خوشه بندی اختصاص داده شود. F I نشان دهنده احتمال اینکه تمام ویژگی های زمانی به مرکز خوشه بندی μ μ i اختصاص داده شود. F I at این احتمال را نشان می دهد که تمام ویژگی های زمانی به مراکز مختلف خوشه بندی اختصاص داده می شود.

به منظور توزیع احتمال توزیع نرم لایه خوشه ای q i j سازگار با توزیع هدف کمکی p i j ، واگرایی KL به عنوان از دست دادن لایه خوشه بندی زمانی تعریف می شود ، همانطور که در معادله (10) نشان داده شده است:

خوشه بندی TCN عمیق با استفاده از واگرایی KL ، لایه خوشه بندی زمانی را آموزش می دهد و از این طریق مراکز خوشه بندی U J و پارامترهای رمزگذار AutoEncoder θ (W ، B) را به طور همزمان بهینه می کند. شیب عملکرد از دست دادن L C با توجه به ویژگی زمانی Z I و مرکز خوشه بندی U J به عنوان (11) و (12) محاسبه می شود.

گرادیان ∂ l c ∂ z i به پارامترهای شبکه رمزگذار منتقل می شود و برای محاسبه گرادیان پارامتر شبکه ∂ l c ∂ θ استفاده می شود. در این مطالعه از روش بهینه سازی ADAM برای بهینه سازی عملکرد از دست دادن استفاده شد.

2. 3الگوریتم خوشه بندی عمیق TCN

3. تنظیمات و نتایج آزمایشی

3. 1شرح داده ها

در این مقاله به قیمت بسته شدن دو بازار مهم شاخص در چین و ایالات متحده ، CSI 300 و شاخص S& P 500 می پردازیم. داده های تاریخی Ticker از شاخص CSI 300 از پلت فرم koinquant گرفته شده است و داده های تاریخی Ticker از شاخص S& P 500 از Finance Yahoo تهیه شده است. داده های جمع آوری شده در جدول 1 نشان داده شده است. سهام دارای سیستم تعلیق طولانی مدت و سهام ST از کاغذ خارج شد. مدت زمان داده های جمع آوری شده در آزمایش از 1 ژانویه 2015 تا 1 ژوئیه 2018 بود. ما دوره زمانی را به سه بخش تقسیم کردیم. بخش اول مجموعه آموزش بود. این دوره عمدتاً برای تعریف تعداد بهینه کلاسهای خوشه بندی و انتخاب هایپرپارامترها و همچنین کاربرد برای به دست آوردن نتایج خوشه بندی استفاده می شد. دوره زمانی دوم مجموعه مشاهده بود ، جایی که تجزیه و تحلیل بازده بازار برای مجموعه مشابهی از سهام مختلف که در مرحله قبل به دست آمده انجام شده است. دوره زمانی سوم مرحله پشتی بود که تجزیه و تحلیل تجربی عمدتاً توسط طرح انتخاب سهام به دست آمده از تجزیه و تحلیل انجام می شد. شکل 5a ، B به ترتیب حرکات قیمت بسته شدن ترکیبات به طور تصادفی انتخاب شده از شاخص های S& P 500 و CSI 300 را نشان می دهد.

3. 2تعداد خوشه ها

در این آزمایش از K-Means برای اولیه سازی گروه های خوشه بندی مدل استفاده شده است. با افزایش تعداد خوشه های K ، نمونه ها بیشتر تقسیم می شوند و میزان تجمع هر خوشه به تدریج افزایش می یابد ، و سپس SSE به طور طبیعی به تدریج کاهش می یابد. در زیر ، C I نمایانگر خوشه اول است ، P نشان دهنده نقاط نمونه خوشه مربوطه است ، M نشان دهنده مرکز جرم خوشه مربوطه است ، و SSE خطای خوشه بندی همه نمونه های خوشه ای است ، که برای نشان دادن عملکرد خوشه بندی استفاده می شودوادتعریف در معادله زیر آورده شده است:

ایده اصلی روش آرنج رابطه بین K-Value مربوطه و SSE مربوط به آن است و میزان کاهش SSE با نزدیک شدن K به تعداد بهینه خوشه ها کاهش می یابد. سپس ، با افزایش K و SSE ، کاهش می یابد ، همانطور که در شکل 6 نشان داده شده است.

3. 3تنظیمات پارامتری

پارامترهای شبکه ساختار رمزگذار TCN برای این آزمایش در جدول 2 نشان داده شده است. ویژگی های لایه ورودی از قیمت بسته شدن سهام که با قیمت بسته شدن روز گذشته تقسیم شده است ، استفاده می کند ، که سپس در لایه رمزگذاری و رمزگشایی تغذیه می شود. ساختار شبکه. لایه رمزگذاری با ردیف های دو تا هشت در جدول 2 مطابقت دارد ، که عمدتا یک عملیات افزایش ابعاد را بر روی داده ها انجام می داد. علاوه بر این ، لایه رمزگشایی با ردیف های ده تا هجده در جدول 2 مطابقت دارد ، که عمدتا یک عمل کاهش ابعاد را بر روی داده ها انجام می داد. بعد حالت پنهان به 320 بعد تنظیم شد. تعداد تکرارهای رمزگذار روی 100 و بهینه ساز آدام در طی فرایند آموزش به تصویب رسید. در همین حال ، نرخ یادگیری اولیه به 0. 001 تعیین شد. تعداد کل پارامترهایی که برای شبکه آموزش داده می شود به 309. 644 رسیده است.

3. 4شاخص های ارزیابی

روشهای ارزیابی برای نتایج خوشه بندی به طور کلی می توانند به روشهای ارزیابی داخلی و خارجی تقسیم شوند. یک ارزیابی خارجی خوب بودن نتایج خوشه بندی را هنگام شناخته شدن برچسب های واقعی ارزیابی می کند ، و از آنجا که هیچ برچسب واقعی برای داده های سهام وجود ندارد ، از ارزیابی داخلی استفاده شده است. برای یک روش خوشه بندی ، یک جمع شدن داخل خوشه پایین تر و اتصال بین خوشه ای بالاتر می تواند عملکرد بهتری از روش خوشه بندی را نشان دهد. در این مقاله ، SC (نمره silhouette) [24] ، CH (Calinsk i-Harabaz) [25] و DB (دیوی س-بولدین) [26] برای ارزیابی عملکرد خوشه بندی اتخاذ شدند.

3. 4. 1. قصبها

SC راهی برای ارزیابی اثربخشی خوشه بندی است. SC طیف وسیعی از [1 - 1] و هرچه SC بزرگتر باشد ، عملکرد خوشه بندی بهتر می شود. تعاریف در معادلات (14) و (15) تعریف شده است.

معادله (14) SC را برای یک نمونه واحد نشان می دهد ، جایی که A I میانگین فاصله بین خوشه ای را که نمونه ITH به آن تعلق دارد و نمونه های دیگر در همان خوشه را نشان می دهد. اگر فقط یک نمونه در خوشه وجود داشته باشد ، S C I = 0. i ∈ A ، a i = متوسط j ∈ A ، i ≠ j (dist (i ، j)) ، جایی که a یکی از خوشه های K را نشان می دهد. B I حداقل مقدار متوسط فاصله بین نمونه ITH و سایر خوشه ها را نشان می دهد. I ∈ A ، C ≠ A ، Dist (I ، C) = متوسط J ∈ C (Dist (I ، J)). b i = min c ≠ a dist (i ، c).

3. 4. 2. چاک

CH همچنین شاخصی برای ارزیابی اثرات خوشه بندی خوب یا بد است که بسیار سریعتر از SC محاسبه می شود و به شرح زیر محاسبه می شود.

جایی که S S B واریانس بین خوشه ها و S S W واریانس در خوشه ها است. نسبت فشرده سازی به جداسازی ، شاخص C H است ، جایی که C q نقطه مرکزی خوشه q را نشان می دهد ، C E نقطه مرکزی مجموعه داده ها را نشان می دهد ، n q تعداد داده ها را در خوشه q نشان می دهد ، و C q نشان دهنده مجموعه داده خوشه استس. مجموع مسافت های مربع بین هر نقطه خوشه و مرکز آن برای تعیین فشرده سازی خوشه استفاده می شود. از مجموع مسافت های مربع بین مراکز خوشه ای و مرکز مجموعه داده ها به عنوان یک کل برای تعیین میزان جدایی بین مجموعه داده ها استفاده می شود. شاخص C H بالاتر نشانگر بازده خوشه بندی بهبود یافته است.

3. 4. 3. DB

DB برای تعیین عملکرد الگوریتم خوشه بندی ، که به شرح زیر محاسبه می شود ، از فاصله بین گروه فاصله و پراکندگی داخل سلولی ترکیب می کند:

جایی که σ k پراکندگی داخل سلولی خوشه K است ، d k k ′ = u k - u k ′ ، و d k k ′ فاصله بین خوشه ای بین خوشه های k و k است ، جایی که u k و u k نشانگر فاصله بین k و k و k استبه ترتیب مراکز کلاس خوشه ای. یک D B کوچک به معنای عملکرد خوشه ای خوب است.

3. 5نتایج و تجزیه و تحلیل

به منظور تأیید اثربخشی روش پیشنهادی ، یک سری از معیارهای تجربی درجه تجمع خوشه بندی با مقایسه روش پیشنهادی با روشهای خوشه بندی عمومی و همچنین روشهای خوشه بندی عمیق بدست آمد. دو دسته از الگوریتم های خوشه بندی برای مقایسه برای تأیید اثربخشی خوشه بندی های عمیق TCN استفاده شد. دسته اول شامل K-Means عمومی ، K-شکل ، طیفی و غیره است. این الگوریتم ها فقط از ویژگی های اصلی داده ها استفاده می کنند و وابستگی های زمانی داده ها عمیقاً استخراج نمی شوند. برای تأیید اینکه عملکرد خوشه بندی می تواند توسط شبکه های عصبی عمیق بهبود یابد ، چندین آزمایش مقایسه ای انجام شد. دسته دوم یک الگوریتم خوشه بندی عمیق را اتخاذ کرد ، که DEC یک الگوریتم معمولی است. همچنین می تواند عملکرد خوشه بندی را با استخراج ویژگی بهینه کند اما نسبت به سری زمانی مالی حساس نیست.

روش پیشنهادی در دو بازار شاخص تأیید شد و عملکرد در جدول 3 و جدول 4 به تفصیل نشان داده شده است. به طور کلی ، الگوریتم های خوشه بندی عمیق از الگوریتم های عمومی از نظر تجمع خوشه بندی بهتر است. اگرچه K-Mean بهترین الگوریتم های خوشه بندی کلی را انجام می داد ، اما تجمع خوشه بندی آن هنوز هم بسیار کوچکتر از الگوریتم های خوشه ای عمیق بود. در همین حال ، طیفی از همه الگوریتم های خوشه بندی بدترین عملکرد را داشت. در مورد استخراج ویژگی ها ، DEC از نظر CH و DB در شاخص S& P 500 بدتر از خوشه بندی TCN بود ، در حالی که SC فقط یک برتری جزئی داشت. در مقابل ، خوشه بندی عمق TCN در مورد معیارهای ارزیابی در شاخص CSI 300 بهترین عملکرد را داشت.

برای نشان دادن بیشتر اثربخشی خوشه بندی خوشه بندی عمیق TCN ، تجسم زیر نشان داده شده است که عقلانیت در پشت خوشه بندی شده در شکل 7 و شکل 8 را توضیح می دهد. چهار خوشه مختلف به طور تصادفی از هر یک از دو بازار انتخاب شدند. همانطور که در این ارقام نشان داده شده است ، سهام خوشه ای خوشه ای TCN با روند قیمت مشابه. با در نظر گرفتن شاخص S& P500 به عنوان نمونه ، خوشه بندی عمیق TCN قادر به طبقه بندی آنها در طول بازارهای روند ، روند نزولی و نوسان بود. به عنوان مثال ، خوشه در شکل 7c شامل دو شرکت ، GOOG و GOOGL است که مشاغل مشابهی را اداره می کنند و روند قیمت یکسانی دارند. با این حال ، این خوشه همچنین شامل سهام غیر فناوری مانند EW و FLSV است که همچنین به یک روش نشان می دهد که قیمت سهام تحت تأثیر عدم قطعیت در صنایع مختلف قرار دارد.

4. تجزیه و تحلیل پشتی

در این بخش ، نتایج خوشه بندی سهام های متعدد با استفاده از الگوریتم خوشه بندی پیشنهادی تجزیه و تحلیل می شود. بر اساس ترکیب نتایج خوشه بندی خوشه بندی TCN عمیق و عملکرد تاریخی سهام فردی ، تعدادی از سهام خاص نماینده نمایش داده می شود. بنابراین ، یک استراتژی انتخاب سهام مبتنی بر خوشه بندی ساخته شده است ، که نشان دهنده اهمیت هدایت الگوریتم خوشه بندی ارائه شده در این مقاله در زمینه مالی است.

ساخت استراتژی انتخاب سهام بر اساس نتایج خوشه بندی

استراتژی انتخاب سهام در حدود یک فرضیه چرخیده است: سهام در همان خوشه دارای حرکات قیمت مشابهی هستند و در طی یک دوره زمانی معین بازده مشابهی دارند. در طول دوره مشاهده ، ما برای اولین بار با تعیین آستانه های مختلف ، سهام را انتخاب کردیم که بالاتر از حد متوسط یا پایین تر بودند. در طول دوره آزمایش ، ما سهام را بر اساس آنهایی که بالاتر از حد متوسط هستند خریداری کردیم و سهام خود را بر اساس موارد زیر متوسط ، همانطور که در شکل 9 نشان داده شده است ، فروخته ایم.

با انتخاب سهام مورد نیاز برای خرید و فروش در دوره آزمایش ، ما فهمیدیم که در بیشتر موارد ، سهام انتخاب شده بازده بالاتری نسبت به بازده متوسط بازار دارد ، به عنوان مثال در بازار شاخص S& P 500 نشان داده شده در جدول 5 ، در جدول 5 ، در جدول 5مواردی که آستانه ها به 0. 02 ، 0. 04 ، 0. 06 ، 0. 08 ، 0. 1 تنظیم شده اند ، سهام برای خرید بازده بالاتری نسبت به بازده متوسط بازار نشان داد. وقتی آستانه به 0. 1 تنظیم شد ، این استراتژی از میانگین بازار 0. 77 ٪ بهتر بود. به طور مشابه ، در بازار شاخص CSI 300 نشان داده شده در جدول 6 ، بازده حداکثر 2. 41 ٪ (بازده سالانه می تواند به 28. 89 ٪ برسد) هنگامی که آستانه به 0. 02 تنظیم شد. البته ، عدم اطمینان در بازار وجود دارد ، به عنوان مثال ، در بازار شاخص S& P 500 که آستانه به 0. 02 تعیین شده بود ، بازگشت به خرید پایین تر از بازده متوسط بازار بود ، و این نیز در بازار CSI منعکس شد.

از نتایج فوق ، می توان تأیید کرد که خوشه بندی عمیق TCN را می توان با یک استراتژی انتخاب سهام بر اساس عملکرد قیمت تاریخی ترکیب کرد تا سهام را بدست آورد که از بازده متوسط بهتر است. به طور خاص ، سرمایه گذاران می توانند دوره ای را در گذشته برای تجزیه و تحلیل خوشه بندی انتخاب کنند و آستانه مربوطه را برای سرمایه گذاری با توجه به تحمل ریسک سرمایه گذاری خود انتخاب کنند ، در این زمان استخر خرید و فروش مربوط به فروش ، مربوط به سهام موجود در استخر خرید است که می تواند باشد. خریداری یا اضافه شده و سهام موجود در استخر فروش که می تواند فروخته یا کاهش یابد.

5. نتیجه گیری ها

در این مقاله، ما یک الگوریتم جدید خوشه بندی زمانی عمیق را پیشنهاد می کنیم که به عنوان خوشه بندی عمیق TCN تعریف شده است، که از قابلیت استخراج ویژگی مهم شبکه های TCN در زمینه سری های زمانی همراه با از دست دادن خوشه بندی الگوریتم های شبکه خوشه بندی عمیق برای حل مشکلات استفاده می کند. استخراج دستی ویژگی الگوریتم های خوشه بندی عمومی و عدم حساسیت شبکه های خوشه بندی عمیق موجود به ویژگی های سری زمانی. اجسام آزمایشی مؤلفه های شاخص مهم دو کشور چین و ایالات متحده آمریکا هستند. با نتایج تجربی تأیید می شود که روش پیشنهادی می تواند سهامی با روند قیمت مشابه پیدا کند و تا حدی از الگوریتم خوشه بندی عمومی و الگوریتم خوشه بندی عمیق بهتر عمل کند. برای اعتبار بیشتر عملی بودن مطالعه، یک استراتژی انتخاب سهام استنتاج با انتخاب سهامی ساخته می شود که در یک خوشه خوب یا ضعیف عمل می کنند. از طریق این استراتژی انتخاب سهام، روش پیشنهادی می تواند به بازده خوبی در بازار واقعی دست یابد. با برتری در زمینه مالی، روش پیشنهادی می تواند نتایج قابل توجهی را در سایر زمینه های سری زمانی نیز به دست آورد.

مشارکت های نویسنده

مدیریت داده، M. L. روش شناسی، M. L. منابع، Y. C. Writing-پیش نویس اصلی، Y. C. و م. ل. نگارش-بررسی و ویرایش، M. L., G. C., C. Z. و ز. سی. همه نویسندگان نسخه منتشر شده نسخه خطی را خوانده و با آن موافقت کرده اند.

منابع مالی

این تحقیق توسط پروژه های تحقیقاتی علمی عمومی اداره آموزش و پرورش استان ژجیانگ (Y202249481) تامین شده است.

بیانیه در دسترس بودن داده ها

داده هایی که یافته های این مطالعه را پشتیبانی می کنند، در صورت درخواست معقول از نویسنده مسئول، Y. C. در دسترس هستند.

قدردانی ها

تضاد علاقه

نویسندگان هیچ تضاد منافع را اعلام نمی کنند. تامین کنندگان مالی هیچ نقشی در طراحی مطالعه نداشتند. در جمع آوری، تجزیه و تحلیل یا تفسیر داده ها؛در نگارش نسخه خطی؛یا در تصمیم گیری برای انتشار نتایج.

بازار رمزارزها...
ما را در سایت بازار رمزارزها دنبال می کنید

برچسب : نویسنده : محمود کیانوش بازدید : <-PostHit-> تاريخ : جمعه 8 ارديبهشت 1402 ساعت: 14:04