این یک مقاله دسترسی آزاد است که تحت شرایط مجوز انتساب Creative Commons توزیع شده است ، که امکان استفاده ، توزیع و تولید مثل بدون محدودیت در هر رسانه را فراهم می کند ، مشروط بر اینکه نویسنده و منبع اصلی اعتبار داشته باشند.
داده های مرتبط
چکیده
پیش بینی قیمت سهام یک کار چالش برانگیز است ، که در آن اخیراً از روشهای یادگیری ماشین با موفقیت استفاده شده است. در این مقاله ، ما بیش از 270 ویژگی دست ساز (فاکتورها) با الهام از شاخص های فنی و تجزیه و تحلیل کمی را استخراج می کنیم و اعتبار آنها را در پیش بینی حرکت کوتاه مدت قیمت متوسط برای سهام Nordic TotalView-Chitch آزمایش می کنیم. لیست ویژگی های پیشنهادی یکی از گسترده ترین مطالعات در زمینه مهندسی ویژگی های مالی را نشان می دهد. ما روی یک روش انتخاب ویژگی بسته بندی با استفاده از آنتروپی ، مربع های حداقل متوسط و تجزیه و تحلیل تبعیض آمیز خطی تمرکز می کنیم. ما همچنین یک ویژگی کمی جدید را بر اساس رگرسیون لجستیک تطبیقی برای یادگیری آنلاین معرفی می کنیم. ویژگی پیشنهادی به طور مداوم به عنوان اولین ویژگی در بین تعداد زیادی از شاخص های مورد استفاده در این مطالعه انتخاب می شود. ما در ادامه بهترین ترکیبات ویژگی ها را با استفاده از یک پایگاه داده Nordic با سفارش محدود با فرکانس بالا بررسی می کنیم. نتایج ما نشان می دهد که می توان از روشهای مرتب سازی و طبقه بندی کننده ها به گونه ای استفاده کرد که با ترکیبی از تنها چند ویژگی پیشرفته دستی ، می توان به بهترین عملکرد طبقه بندی برسد.
مقدمه
مشکل مورد نظر در این مقاله پیش بینی حرکت قیمت متوسط سهام (یعنی ، بالا ، پایین یا حالت ثابت) در معاملات با فرکانس بالا (HFT) است. در یک زمان معین ، قیمت متوسط سهام به عنوان میانگین بهترین قیمت های سؤال و پیشنهاد تعریف می شود. قیمت متوسط به عنوان اطلاعات حیاتی برای سازندگان بازار که به طور مداوم موجودی ها را متعادل می کنند و همچنین برای معامله گرانی که باید بتوانند به درستی پیش بینی جهت حرکات بازار را داشته باشند ، در نظر گرفته می شود. علاوه بر این ، قیمت متوسط روند نظارت بر ثبات بازارها (یعنی شناسایی جعل) را تسهیل می کند. مفهوم پیش بینی قیمت میانی را می توان به شرح زیر توصیف کرد: در یک زمان معین t ، وضعیت سهام در یک بازنمایی مبتنی بر بردار رمزگذاری می شود که با استفاده از اطلاعات سری زمانی چند بعدی از یک پنجره زمانی کوتاه مدت محاسبه می شودطول t. با توجه به این نمایندگی ، جهت قیمت میانی در افق Δ t پیش بینی می شود.
در طی چند سال گذشته ، چندین روش ، مانند مواردی که در [1-6] شرح داده شده است ، و [7] برای تجزیه و تحلیل داده های بازار سهام پیشنهاد شده است. همه این روشها از خط لوله طبقه بندی استاندارد تشکیل شده توسط دو مرحله پردازش پیروی می کنند. با توجه به یک نمونه زمانی در طی مراحل معاملاتی ، وضعیت بازار بر اساس یک پنجره زمانی (معمولاً کوتاه) که قبل از نمونه فعلی توصیف شده است ، توصیف می شود. مجموعه ای از ویژگی های دست ساز برای توصیف پویایی بازار انتخاب شده و منجر به نمایندگی وکتور می شود. بر اساس چنین نمایندگی ، یک طبقه بندی کننده برای پیش بینی وضعیت بازار در یک نمونه زمانی در یک افق پیش بینی ، همانطور که در شکل 1 نشان داده شده است ، استفاده می شود.

پیش بینی قیمت متوسط بر اساس پنج کتاب سفارش محدود ، سطح قیمت را بپرسید که در آن T دوره استخراج ویژگی آموزش و Δ T افق پیش بینی شده است.
اکثر مطالعات ، همانطور که در بخش ادبیات مورد بحث قرار گرفته است ، از تعداد محدودی از ویژگی ها استفاده می کنند بدون اینکه انگیزه ای در مورد انتخاب آنها ارائه دهند. در این مقاله ، ما تعداد زیادی از شاخص های فنی ، ویژگی های پیشرفته کتاب سفارش (LOB) و شاخص های کمی را به کار می بریم [8]. ما بیشتر یک ویژگی کمی جدید را پیشنهاد می کنیم که برای اولین بار در بین چندین ویژگی برای وظیفه پیش بینی حرکت قیمت متوسط انتخاب می شود. استفاده از ویژگی های مختلف دست ساز منجر به رمزگذاری خواص مختلف سری زمانی مالی می شود و حذف برخی از این ویژگی ها می تواند منجر به عدم بهره برداری از اطلاعات مربوطه شود. تعریف مجموعه خوبی از ویژگی ها به طور مستقیم به عملکرد تجزیه و تحلیل بعدی متصل است زیرا هرگونه اطلاعات دور ریخته شده در این مرحله نمی تواند بعداً توسط طبقه بندی کننده بازیابی شود.
یک رویکرد متداول برای رفع این مشکل استفاده از روش های انتخاب ویژگی (به عنوان مثال ، [9 ، 10]) است که می توان با استفاده از انواع مختلف معیارها برای رتبه بندی ویژگی به صورت بسته بندی انجام داد. در حالی که استفاده از تکنیک های کاهش ابعادی مبتنی بر تحول مانند تجزیه و تحلیل مؤلفه اصلی (PCA) یا تجزیه و تحلیل تبعیض آمیز خطی می تواند به یک خط لوله پردازش مشابه منجر شود ، در این مقاله ، ما علاقه مند به تعریف مجموعه ای از ویژگی هایی هستیم که بیشتر اطلاعات را در آن منتقل می کندداده. PCA در این مطالعه در نظر گرفته نمی شود زیرا ویژگی های موجود را به موارد جدید تبدیل می کند که قابل تفسیر نیستند. این بدان معناست که ما قادر به ارائه بینشی نخواهیم بود که ویژگی های خاص برای وظیفه پیش بینی حرکت قیمت متوسط مناسب است. استفاده از انتخاب ویژگی با استفاده از معیارهای بدون نظارت و به ویژه معیار حداکثر آنتروپی در [11] و [12] استفاده شده است. انگیزه این رویکرد این واقعیت است که با افزایش آنتروپی یک ویژگی (هنگامی که در مجموعه ای از داده ها محاسبه می شود) ، واریانس داده ها و بنابراین ، اطلاعاتی که رمزگذاری می کند نیز افزایش می یابد. با این حال ، ترکیبی از بسیاری از ویژگی های آنتروپی بالا در یک بازنمایی مبتنی بر وکتور لزوماً منجر به عملکرد طبقه بندی خوب نمی شود. این امر به این دلیل است که ابعاد مختلف بازنمایی داده های تصویب شده نیاز به رمزگذاری اطلاعات مختلف دارد.
سهم اصلی کار ما سه برابر است. اولین سهم استفاده از لیست گسترده ای از شاخص های فنی برای تجارت با فرکانس بالا است. سهم دوم یک ویژگی کمی جدید است ، به نام ویژگی رگرسیون لجستیک سازگار ، که برای اولین بار در بین چندین معیار انتخاب ویژگی انتخاب شد. سهم سوم ارزیابی گسترده ای از سه مجموعه ویژگی (به عنوان مثال ، شاخص های فنی ، کمی و LOB) از طریق تبدیل (I) آنتروپی ، (ب) تجزیه و تحلیل تبعیض آمیز خطی (LDA) و (III) میانگین مربعات خطی (میانگین) است. LMS) به عنوان معیارهای انتخاب ویژگی. شبکه عملکرد LMS ، LDA و شعاعی (RBFN) به عنوان طبقه بندی کننده برای کار پیش بینی حرکت قیمت متوسط استفاده می شود. یافته های ما نشان می دهد که بهترین عملکرد با استفاده از تنها چند ویژگی (پیشرفته) حاصل از مجموعه های ویژگی های دست ساز کمی و فنی حاصل می شود.
این تحقق های مختلف (به عنوان مثال ، آنتروپی ، LMS و LDA) از روش انتخاب ویژگی در استخر گسترده ای از ویژگی های دست ساز استفاده می شود ، که برای پوشش هر دو ویژگی اساسی و پیشرفته از دو رویکرد مختلف معاملاتی انتخاب شده اند (به عنوان مثال ، آنهایی که تمرکز دارنددر تجزیه و تحلیل فنی و کمی). تجزیه و تحلیل فنی مبتنی بر این واقعیت است که با نظارت بر نمودارهای قیمت و حجم می توان پیش بینی قیمت را بدست آورد ، در حالی که تجزیه و تحلیل کمی بر مدل های آماری و برآورد پارامتر متمرکز است. برای شاخص های فنی ، ما ویژگی های اساسی و پیشرفته همراه با فیلترهای دیجیتال را محاسبه می کنیم ، در حالی که برای شاخص های کمی ، ما در درجه اول روی تجزیه و تحلیل سری زمانی تمرکز می کنیم. ویژگی ها و توضیحات مربوطه آنها به عنوان ورودی در دوازده مدل انتخاب ویژگی (هر یک از آنها مربوط به یک معیار و طبقه بندی کننده متفاوت) برای کار طبقه بندی ارائه شده است. ما بهترین ترکیب این دو نوع ویژگی را ارائه می دهیم و مقایسه ای از دو سبک معاملاتی از مجموعه ویژگی ها را از نظر عملکرد F1 ارائه می دهیم. نمره F1 یک آزمایش رایج است که برای اندازه گیری عملکرد استفاده می شود و به عنوان میانگین هارمونیک دقت و فراخوان محاسبه می شود. به بهترین دانش ما ، این اولین مطالعه ای است که تعریف می کند از کدام نوع اطلاعات برای توضیحات و طبقه بندی سری زمانی با فرکانس بالا استفاده می شود.
ادامه مقاله به شرح زیر تدوین شده است. ما ابتدا یک بررسی جامع ادبیات از ویژگی های فنی و کمی و به دنبال آن بیانیه مشکل و توضیحات داده ها ارائه می دهیم. سپس ما تحقق های مختلفی از روش بسته بندی شده اتخاذ شده در تحلیل خود ، همراه با نتایج تجربی ارائه می دهیم. شرح مفصلی از کلیه ویژگی های مورد استفاده در آزمایشات ما و همچنین تمام لیست های رتبه بندی برای هر روش را می توان در بخش پیوست یافت.
کار مرتبط
تجارت الگوریتمی از رایانه ها ، طبق قوانین خاص ، برای انجام سریع محاسبات دقیق بر اساس تجزیه و تحلیل آماری استفاده می کند. یک معامله گر با استفاده از تکنیک های Leaing Machine (ML) می تواند از ابزارهای مختلفی بر اساس این تجزیه و تحلیل استفاده کند تا بهترین استراتژی تجارت را انتخاب کند. با این حال ، تعدادی از چالش ها برای حل باقی مانده است. اول ، چگونه می توان تعیین کرد که کدام شاخص ها (یعنی ویژگی ها) قادر به ایجاد یک حرکت سودآور هستند؟دوم ، آیا قیمت های گذشته و حال شامل تمام اطلاعات مربوطه است؟چندین نویسنده از شاخص های فنی و تجزیه و تحلیل کمی برای چندین کار با استفاده از مجموعه محدود از این ویژگی ها استفاده کردند. الگوهای پنهان استخراج شده از داده های گذشته و همچنین مدل های آماری می توانند اطلاعات مربوطه را به معامله گر ML ارائه دهند.< SPAN> تجارت الگوریتمی از رایانه ها ، طبق قوانین خاص ، برای انجام سریع محاسبات دقیق بر اساس تجزیه و تحلیل آماری استفاده می کند. یک معامله گر با استفاده از تکنیک های Leaing Machine (ML) می تواند از ابزارهای مختلفی بر اساس این تجزیه و تحلیل استفاده کند تا بهترین استراتژی تجارت را انتخاب کند. با این حال ، تعدادی از چالش ها برای حل باقی مانده است. اول ، چگونه می توان تعیین کرد که کدام شاخص ها (یعنی ویژگی ها) قادر به ایجاد یک حرکت سودآور هستند؟دوم ، آیا قیمت های گذشته و حال شامل تمام اطلاعات مربوطه است؟چندین نویسنده از شاخص های فنی و تجزیه و تحلیل کمی برای چندین کار با استفاده از مجموعه محدود از این ویژگی ها استفاده کردند. الگوهای پنهان استخراج شده از داده های گذشته و همچنین مدل های آماری می توانند اطلاعات مربوطه را به Trader ML ارائه دهند. تجارت Algorithmic از رایانه ها ، طبق قوانین خاص ، برای انجام سریع محاسبات دقیق بر اساس تجزیه و تحلیل آماری استفاده می کند. یک معامله گر با استفاده از تکنیک های Leaing Machine (ML) می تواند از ابزارهای مختلفی بر اساس این تجزیه و تحلیل استفاده کند تا بهترین استراتژی تجارت را انتخاب کند. با این حال ، تعدادی از چالش ها برای حل باقی مانده است. اول ، چگونه می توان تعیین کرد که کدام شاخص ها (یعنی ویژگی ها) قادر به ایجاد یک حرکت سودآور هستند؟دوم ، آیا قیمت های گذشته و حال شامل تمام اطلاعات مربوطه است؟چندین نویسنده از شاخص های فنی و تجزیه و تحلیل کمی برای چندین کار با استفاده از مجموعه محدود از این ویژگی ها استفاده کردند. الگوهای پنهان استخراج شده از داده های گذشته و همچنین مدل های آماری می توانند اطلاعات مربوطه را به معامله گر ML ارائه دهند.
تجزیه و تحلیل فنی (به عنوان مثال ، [13]) به طور سنتی نسبت به تجزیه و تحلیل کمی ، نظارت کمتری را دریافت کرده است. با این وجود ، چندین مطالعه از شاخص های فنی به عنوان مکانیسم اصلی تجزیه و تحلیل سیگنال و پیش بینی قیمت استفاده می کنند. در حوزه HFT ، نویسندگان [14] از هفت خانواده قانون تجارت به عنوان معیار تأثیر سرعت تجارت استفاده می کنند ، در حالی که در [15] نویسندگان فقط چند شاخص فنی را برای معاملات پر سرعت ارائه می دهند. در دوره ML فعلی ، نویسندگان در [1] از شش شاخص فنی اساسی به عنوان بازنمایی ویژگی برای یک سیستم پشتیبانی تصمیم گیری بر اساس شبکه های عصبی مصنوعی (ANN) استفاده کردند. فقط ده شاخص فنی در [16] به عنوان ویژگی های ورودی برای چندین الگوریتم میلی لیتر (یعنی ANN ، ماشین های بردار پشتیبانی ، جنگل تصادفی و خلیج های ساده لوح) برای پیش بینی روند سهام استفاده می شود. با این حال ، همچنین می توان به تجزیه و تحلیل کمی متوسل شد ، که شامل معامله گران ML است که هنگام تصمیم گیری در مورد تجارت ، از شاخص های پیچیده ریاضی و آماری استفاده می کنند. امور مالی کمی یک زمینه گسترده است ، از جمله بهینه سازی نمونه کارها (به عنوان مثال ، [17 ، 18]) ، قیمت گذاری دارایی (به عنوان مثال ، [19 ، 20]) ، مدیریت ریسک (به عنوان مثال ، [21 ، 22]) و تجزیه و تحلیل سری زمانی (به عنوان مثال.، [23 ، 24]). در این کار ، ما روی تجزیه و تحلیل سری زمانی تمرکز می کنیم و از ایده های تحلیل سری زمانی کمی مالی که برای یادگیری ماشین اتخاذ شده است استفاده می کنیم. به عنوان مثال ، نویسندگان در [25] از دستگاه های بردار پشتیبانی و درختان تصمیم گیری از طریق تجزیه و تحلیل همبستگی برای پیش بینی بازار سهام استفاده می کنند. یکی دیگر از جنبه های تجزیه و تحلیل کمی ، ساخت استراتژی های معاملاتی مانند بازده میانگین است که در [26] آزمایش شده است). جنبه دیگری از تجزیه و تحلیل کمی محاسبه عدم تعادل کتاب سفارش برای استراتژی های عدم تعادل سفارش است. این ایده به عنوان یکی از ویژگی های یک شبکه عصبی عمیق در [4] استفاده می شود.
در کار حاضر ، ما بر روی ویژگی های دست ساز استخراج شده بر اساس تجزیه و تحلیل فنی و کمی تمرکز می کنیم. ما نشان می دهیم که ترکیبی از ویژگی های به دست آمده از این گروه ها می تواند توانایی پیش بینی الگوریتم ها را بهبود بخشد. یک روش ترکیبی توسط [27] برای پیش بینی بازده دارایی بر اساس شاخص های فنی و مدل های سری زمانی استفاده می شود. به بهترین دانش ما این اولین تلاش برای مقایسه این مدارس تجاری با استفاده از چندین روش انتخاب ویژگی در یک روش بسته بندی در HFT است.
فرمول مسأله
HFT نیاز به تجزیه و تحلیل مستمر پویایی بازار دارد. یکی از راه های فرمول بندی این پویایی ها، ساخت یک کتاب سفارش محدود (LOB) است، همانطور که در جدول 1 نشان داده شده است. LOB جریان سفارش تجمعی است که نشان دهنده دستورات محدود معتبر است، که اجرا و یا لغو نشده اند، که در فهرست به اصطلاح پیام، همانطور که در جدول 2 نشان داده شده است، فهرست شده اند. LOB ها سیگنال های چند بعدی هستند که توسط فرآیندهای تصادفی توصیف می شوند و دینامیک آنها به عنوان توابع càdlàg توصیف می شود (یعنی [2]). توابع برای یک سفارش حدی خاص (یعنی یک سفارش با ویژگی های خاص از نظر قیمت و حجم در یک زمان خاص t)، به صورت t فرموله می شوند: سفارش = (t، قیمت)تی، جلدتی) که در زمان t فعال می شود به این صورت است که: o r d e r ∈ L (t ) , o r d e r ∉ l i m o r d e r ′ ↑ o r d e r x L ( o r d er ′ ) . بسته به نحوه ساخت LOB، ما اطلاعات جدید را بر اساس ورود رویدادها بررسی می کنیم. هدف کار ما پیش بینی جهت (یعنی بالا، پایین یا ثابت) قیمت متوسط است (یعنی (صآ+ صب)/2، جایی که صآقیمت درخواستی و p استبقیمت پیشنهادی در سطح اول LOB است). هدف استفاده از ویژگی های اطلاعاتی بر اساس جریان سفارش (یعنی فهرست پیام یا کتاب پیام [MB]) و LOB است که به معامله گر ML کمک می کند تا دقت پیش بینی حرکت متوسط قیمت را بهبود بخشد.
میز 1
LOB به 10 سطح تقسیم می شود که هر سطح از چهار ستون تشکیل شده است. این چهار ستون به ترتیب به قیمت و حجم درخواستی و قیمت و حجم پیشنهادی اشاره دارد. بهترین سطح سطح 1 است. شامل بهترین قیمت درخواستی است که حداقل قیمتی است که فروشنده حاضر است برای سهمی از سهام بپذیرد و بهترین قیمت پیشنهادی که حداکثر قیمتی است که خریدار مایل است برای یک سهم بپردازد. از سهامدر کنار سطح 1، سطح 2 و غیره قرار دارد، تا سطح 10 با همان شکل گیری اما با بدترین قیمت های Ask and Bid.
| سطح 1 | سطح 2 | … |
| پرسیدن | پیشنهاد | پرسیدن | پیشنهاد |
| مهر زمان | قیمت متوسط | گسترش | قیمت | تعداد | قیمت | تعداد | قیمت | تعداد | قیمت | تعداد |
| 1275386347944 | 126200 | 200 | 126300 | 300 | 126100 | 17 | 126400 | 4765 | 126000 | 2800 | … |
| 1275386347981 | 126200 | 200 | 126300 | 300 | 126100 | 17 | 126400 | 4765 | 126000 | 2800 | … |
| 1275386347981 | 126200 | 200 | 126300 | 300 | 126100 | 17 | 126400 | 4765 | 126000 | 2800 | … |
| 1275386348070 | 126050 | 100 | 126100 | 291 | 126000 | 2800 | 126200 | 300 | 125900 | 1120 | … |
| 1275386348070 | 126050 | 100 | 126100 | 291 | 126000 | 2800 | 126200 | 300 | 125900 | 1120 | … |
| 1275386348101 | 126050 | 100 | 126100 | 291 | 126000 | 2800 | 126200 | 300 | 125900 | 1120 | … |
جدول 2
این یک کتاب پیام معمولی است که حاوی اطلاعات خام معاملاتی است. هر ردیف کتاب پیام حاوی اطلاعاتی در مورد زمان ورود تجارت، شناسه معامله، قیمت سهام، حجم سهام، نوع رویداد و سمت معامله است.
| مهر زمان | Id | قیمت | جلد | رویداد | سمت |
| 1275377039033 | 1372349 | 341100 | 300 | ارسال | پیشنهاد |
| 1275377039033 | 1372349 | 341100 | 300 | لغو | پیشنهاد |
| 1275377039037 | 1370659 | 343700 | 100 | ارسال | پرسیدن |
| 1275377039037 | 1370659 | 343700 | 100 | لغو | پرسیدن |
| 1275377039037 | 1372352 | 341700 | 150 | ارسال | پیشنهاد |
| 1275377039037 | 1372352 | 341700 | 150 | لغو | پیشنهاد |
استخر ویژگی
کتاب سفارش محدود (LOB) و کتاب پیام (MB) منابع اصلی هستند که از آن ویژگی ها استخراج می شوند. ما یک لیست جامع از ویژگی های کاوش در ادبیات برای تجارت فنی و کمی در جدول 3 ارائه می دهیم. توضیحات ویژگی های دست ساز ، به جز ویژگی تازه معرفی شده ، به نام ویژگی رگرسیون لجستیک Adaptive ، در پیوست ارائه شده است که در آن توضیحات ویژگی تازه معرفی شده ، به نام ویژگی رگرسیون لجستیک سازگار ، در زیر آمده است. انگیزه انتخاب لیست پیشنهادی از ویژگی ها بر اساس بررسی کلیه ویژگی های اساسی و پیشرفته از تجزیه و تحلیل فنی و مقایسه با مدلهای آماری پیشرفته ، مانند رگرسیون لجستیک سازگار برای یادگیری آنلاین است. کار حاضر شکافی در ادبیات موجود در مورد عملکرد شاخص های فنی و مقایسه با مدل های کمی مشخص کرده است. این کار زمینه را برای تحقیقات آینده فراهم می کند زیرا بینشی در مورد ویژگی هایی که احتمالاً از نظر قدرت پیش بینی به رتبه بالایی در لیست سفارشات دست می یابند ، ارائه می دهد. برای این منظور ، مجموعه های ویژگی های خود را به سه گروه اصلی تقسیم می کنیم. اولین گروه از ویژگی ها مطابق [28] و [29] استخراج می شود. این گروه از ویژگی ها با هدف ضبط پویایی LOB انجام شده است. این امر ممکن است اگر داده های واقعی LOB خام و شدت نسبی دوره های مختلف نگاه از انواع تجارت را در نظر بگیریم (یعنی قرار دادن سفارش ، اجرای و لغو). گروه دوم ویژگی ها بر اساس تجزیه و تحلیل فنی است. لیست پیشنهادی بسیاری از شاخص های فنی موجود (اساسی و پیشرفته) را توصیف می کند. شاخص های فنی ممکن است به معامله گران کمک کند تا روندها و الگوهای پنهان در سری زمانی خود را نشان دهند. گروه سوم از ویژگی ها با توجه به تجزیه و تحلیل کمی ، که عمدتا بر اساس مدلهای آماری است ، مشتق شده است. این می تواند آماری را ارائه دهد که در داده ها پنهان است. این را می توان با فرآیند رتبه بندی تأیید کرد ، جایی که ویژگی پیشنهادی پیشرفته آنلاین (یعنی رگرسیون لجستیک تطبیقی) در بیشتر معیارهای انتخاب ویژگی (یعنی چهار از پنج لیست ویژگی) در رتبه اول قرار می گیرد. ویژگی های پیشنهادی کاملاً در پیوست شرح داده شده است. در حالی که ، ویژگی رگرسیون لجستیک تطبیقی پیشنهادی در مرحله بعدی شرح داده شده است.
جدول 3
| مجموعه های ویژگی | شرح |
| گروه اول: |
| پایه ای | n سطح داده های LOB |
| حساس | گسترش و قیمت متوسط |
| اختلاف قیمت |
| قیمت و حجم یعنی |
| اختلافات انباشته |
| حساس به زمان | اشتقاق قیمت و حجم |
| شدت متوسط در هر نوع |
| مقایسه شدت نسبی |
| شتاب فعالیت محدود |
| گروه دوم: |
| تجزیه و تحلیل فنی |
| خط توزیع انباشت | نوسان ساز عالی |
| نوسان ساز شتاب دهنده | شاخص جهت متوسط |
| میانگین رتبه شاخص حرکت جهت دار | میانگین متحرک جابجا شده بر اساس نشانگر تمساح ویلیامز |
| نوسان ساز قیمت مطلق | نشانگر آرون |
| نوسان ساز | دامنه واقعی متوسط |
| گروههای بولینگر | ابرهای ichimoku |
| اسیلاتور Chande Momentum | نوسان ساز Chaikin |
| خروجی | مرکز اسیلاتور گرانش |
| کانال های دونچی | میانگین متحرک دو نمایی |
| نوسان ساز قیمت | هایکین اشیا |
| بالاترین و پایین ترین پایین | HULL MA |
| قدرت نوار داخلی | کانال های Keltner |
| حرکت نوسان ساز میانگین همگرایی/واگرایی | قیمت متوسط |
| تکانه | میانگین متحرک متغیر |
| دامنه واقعی متوسط عادی | درصد نوسان ساز قیمت |
| نرخ تغییر | شاخص قدرت نسبی |
| توقف پارابولیک و برعکس | انحراف معیار |
| شاخص قدرت نسبی تصادفی | میانگین متحرک نمایی T3-Triple |
| میانگین متحرک سه گانه | میانگین متحرک مثلثی |
| میانگین نمایی سه گانه | شاخص قدرت واقعی |
| نوسان ساز نهایی | وزن نزدیک |
| ویلیامز ٪ r | میانگین متحرک نمایی صفر |
| شیاطین | خط رگرسیون خطی |
| فیلتر دیجیتال: عملکرد انتقال منطقی | فیلتر دیجیتال: فیلتر Savitzky-Golay |
| فیلتر دیجیتال: فیلتر فاز صفر | افست را برداشته و از بین ببرید |
| محاسبه بتا مانند |
| گروه سوم: |
| آنالیز کمی |
| همبستگی |
| همبستگی جزئی |
| ادغام بر اساس تست Engle-Granger |
| سفارش عدم تعادل کتاب |
| رگرسیون لجستیک سازگار |
ویژگی رگرسیون لجستیک تطبیقی پیشنهادی
ما یک مدل رگرسیون لجستیک جدید را معرفی می کنیم که از آن به عنوان یک ویژگی در پروتکل تجربی خود استفاده می کنیم. انگیزه این مدل کارهایی است که در [4] انجام می شود که در آن نقطه کانونی رفتار محلی سطح LOB است. ما این ایده را با انجام یادگیری آنلاین با نرخ یادگیری تطبیقی گسترش می دهیم. ویژگی جدید با در نظر گرفتن آخرین رویداد معاملاتی از بلوک کتاب پیام 10 رویداد تحت یک مکانیسم یادگیری آنلاین عمل می کند و این بدان معنی است که پیش بینی حرکت قیمت میانی بعدی با توجه به آخرین جریان اطلاعات به روز می شود. به طور خاص ، ما از ماتریس Hessian به عنوان نرخ تطبیقی خود استفاده می کنیم. ما همچنین نسبت ضرایب لجستیک را بر اساس رابطه سطح LOB نزدیک به بهترین سطح LOB و مواردی که در LOB عمیق تر هستند گزارش می کنیم. از 0 ≤ Hθ(v) ≤1 و V حجم سهام برای اولین شش سطح بهترین LOB هستند ، ما این مدل را به شرح زیر شکل می دهیم:
عملکرد لجستیک (یعنی عملکرد فرضیه) و θ t v = θ 0 + ∑ j = 1 n θ j v j باشد. برآورد پارامتر با محاسبه احتمال پارامتر در نظر گرفته می شود:
برای نمونه های آموزش M و عملکرد هزینه ، بر اساس این رویکرد احتمالی ، به شرح زیر است:
j (θ) = 1 m ∑ i = 1 m [ - y (i) l o g (h θ (v (i))) - (1 - y (i)) l o g (1 - h θ (v (i)))].
مرحله بعدی فرایند انتخاب θ S برای بهینه سازی (یعنی به حداقل رساندن) J (θ) است. برای انجام این کار ، ما از روش به روزرسانی نیوتن استفاده خواهیم کرد:
شیب کجاست:
و ماتریس هسی:
با v (i) (v (i)) t ∈ R (n + 1) × (n + 1) و y (i) برچسب هایی هستند که به عنوان تفاوت قیمت های پرسش (و پیشنهاد) بهترین سطح محاسبه می شوند. برچسب های پیشنهادی یک مشکل طبقه بندی باینری را توصیف می کنند ، زیرا ما دو ایالت را در نظر می گیریم ، یکی برای تغییر در بهترین قیمت سؤال و دیگری برای تغییر در بهترین قیمت سؤال.
ما محاسبه فوق را به صورت آنلاین انجام می دهیم. فرآیند آنلاین عنصر 9 از هر بلوک 10 مگابایتی را که توسط ضریب θ تانسور مرتبه اول ضرب شده است ، در نظر می گیرد تا رفتار احتمالی را بدست آورد (ما تانسور مرتبه اول به دست آمده را از طریق عملکرد فرضیه فیلتر می کنیم) از 10 مگابایت 10 مگابایتمسدود کردن. خروجی نمایندگی ویژگی است که به عنوان یک مقیاس (یعنی احتمال) پیشنهاد بیان شده و قیمت را به طور جداگانه می پرسید.
روش بسته بندی انتخاب ویژگی
انتخاب ویژگی منطقه ای است که بر روی برنامه های دارای مجموعه داده های چند بعدی متمرکز است. یک معامله گر ML انتخاب ویژگی را به سه دلیل اصلی انجام می دهد: کاهش پیچیدگی محاسباتی ، بهبود عملکرد و به دست آوردن درک بهتر از روند اساسی. انتخاب ویژگی ، به عنوان یک روش پیش پردازش ، می تواند با افزودن ویژگی هایی که حاوی اطلاعات مربوط به کار مورد نظر است ، قدرت طبقه بندی را تقویت کند. دو روش انتخاب ویژگی های متهوریستی وجود دارد: روش بسته بندی و روش مبتنی بر فیلتر (یعنی تحول). ما تصمیم می گیریم طبقه بندی را بر اساس روش بسته بندی انجام دهیم زیرا رابطه بین ویژگی ها را در نظر می گیرد در حالی که روش های فیلتر این کار را نمی کنند.
رویکرد بسته بندی ما شامل پنج معیار انتخاب زیر مجموعه ویژگی های مختلف بر اساس دو روش خطی و یک غیر خطی برای ارزیابی با توضیحات کلی در الگوریتم 1 است که در آن: Lانتخاب کردنلیست ویژگی های بهینه در هر معیار ، ویژگی _ Select نام الگوریتم عملکرد است ، x مجموعه ویژگی های ورودی است ، برچسب ها حرکات قیمت متوسط را نشان می دهند ، L لیست ویژگی های فعلی تا ابعاد ویژگی D است ، nاندازه نمونه ، curr _ x داده های ورودی فعلی تا شماره فعلی I از ویژگی ها به همراه موارد بهینه تا من است ، و بهترین _ D یک بردار است که بهترین ویژگی را از کل لیست ویژگی ها ذخیره می کند. به طور خاص ، ما آنتروپی ، LMS و LDA را به عنوان معیارهای انتخاب ویژگی تبدیل می کنیم. برای دو مورد آخر (به عنوان مثال ، LMS و LDA) ما دو معیار انتخاب متفاوت را به شرح زیر ارائه می دهیم: i) برای LMS معیار اول از L 2-NORM پیروی می کند و متریک دوم یک اندازه گیری تعصب آماری و II) برای LDA است. معیار اول بر اساس نسبت ماتریس پراکندگی در کلاس در حالی است که متریک دوم با توجه به ماتریس پراکندگی بین کلاس بدست می آید. برای ارزیابی طبقه بندی ، ما از LMS ، LDA و یک شبکه عملکرد شعاعی (یعنی [30]) استفاده می کنیم زیرا این موارد در [29] و [31] استفاده شده است. انتخاب ما برای استفاده از این طبقه بندی های خطی و غیرخطی با میزان داده های موجود در مجموعه داده ما مطلع می شود (جزئیات در بخش زیر ارائه می شود). ما عملکرد طبقه بندی را با توجه به دقت ، دقت ، فراخوان و نمرات F1 برای هر ترکیب ممکن از ویژگی های دست ساز با استفاده از LMS ، LDA و RBF ANN اندازه گیری می کنیم. این اقدامات perfromance به شرح زیر تعریف شده است:
بازار رمزارزها...
ما را در سایت بازار رمزارزها دنبال می کنید
برچسب :
نویسنده : محمود کیانوش
بازدید : <-PostHit->
تاريخ : چهارشنبه
16 فروردين
1402 ساعت: 12:16