Изазови и могућности са алгоритмима каузалног откривања: примена на Алцхајмерову патофизиологију
Feb 19, 2022
Ксинпенг Схен1*, Сиси Ма1ет ал
Откривање узрочне структуре (цСД) је проблем идентификације узрочно-последичних веза из великих количина података путем рачунарских метода. Са ограниченом способношћу традиционалних рачунарских метода заснованих на асоцијацијама да открију узрочне везе, цСД методологије постају све популарније. циљ студије је био да се систематски испита да ли (и) методе цСД могу открити познате узрочне везе из опсервационих клиничких података и (ии) да понуде смернице за тачно откривање познатих узрочно-последичних веза. Користили смоАлцхајмерова болест(АД), сложена прогресивна болест, као модел јер добро утврђени докази пружају узрочни графикон „златног стандарда“ за процену. Процењивали смо две цСД методе, брзо узрочно закључивање (ФЦИ) и брзу похлепну претрагу еквивалентности (фГеС) у њиховој способности да открију ову структуру из података које је прикупиоАлцхајмерова болестиницијатива за неуроимагинг (АДни). Користили смо моделе структурних једначина (који нису дизајнирани за цСД) као контролу. Применили смо ове методе у три сценарија дефинисана повећањем количине основног знања датог методама. методе су процењене поређењем насталих узрочно-последичних веза са графиком „златног стандарда“ који је конструисан из литературе. Наменске цСД методе су успеле да открију графиконе који су се скоро поклапали са златним стандардом. за најбоље резултате треба користити цСД алгоритме са лонгитудиналним подацима који обезбеђују што је могуће више претходног знања.
Контакт:joanna.jia@wecistanche.com/ ВхатсАпп: 008618081934791

Ефекатекстракт цистанцхефеноксиетанол гликозиди наАлцхајмерова болест
Аналитика великих података, машинско учење и дубоко учење изазвали су значајно интересовање у области здравствене науке1,2. Због своје одличне тачности предвиђања, они се све више користе за дијагнозу болести и предвиђање ризика3. Међутим, у многим биомедицинским апликацијама, постизање високе тачности предвиђања само по себи није примарни циљ; откривање фактора ризика или механизма који се може променити често је примарно истраживачко питање.
Данашње апликације за машинско учење су углавном засноване на асоцијацијама. Иако фактор ризика може бити повезан са болешћу, то не значи нужно да може да промени процес болести. Почетком 2018. године, испитивање фазе 3 под називом "СУТРА" тестирало је ефекат лека за дијабетес на смањењеАлцхајмерова болест(АД) ризик од деменције4. Студија је мерила таложење амилоида, који је рани знак Алцхајмерове болести и такође је повезан са дијабетесом. Међутим, пошто дијабетес није узрочник амилоидозе, студија није успела у привременој анализи5,6. За успешну интервенцију, фактор ризика на који интервенишемо треба да има узрочну (а не само асоцијативну) везу саболестисход.
Клиничка истраживања су претежно фокусирана на узрочне везе. Клиничка истраживања заснована на хипотезама, на пример, често претпостављају узрочну структуру, скуп каузалних веза између биомаркера и исхода, а истраживачи процењују величину ефекта ових односа (нпр. узрочно-последично закључивање). У таквим истраживањима ваљан је извођење узрочно-последичног закључка, јер претходно знање потврђује да су везе заиста узрочне. Међутим, када нема знања о каузалности, сама каузална структура треба да се открије из података кроз процес познат као откривање узрочне структуре. Уобичајена, али погрешна пракса је да се претпостави делимична узрочна структура и да се она прилагоди на основу излазне статистике прилагођеног модела коришћењем метода као што су модели структурне једначине (СЕМ).
У овом раду, користећи АД биомаркере као предикторе и когницију као исход, поставили смо циљ да одредимо оптималан начин откривања узрочно-последичних веза. Користили смо АД као модел за овај проблем јер је каскада АД биомаркера добро схваћена7 и узрочне везе између примарних предиктора су такође добро окарактерисане тако да се може конструисати графикон „златног стандарда“. Даље, скуп јавних података оАлцхајмерова болест← Иницијатива за неуроимагинг (АДНИ) има на располагању опсежне лонгитудиналне податке који су погодни за систематска поређења планирана у овом рукопису. Овде се фокусирамо на упоређивање резултата из наменских алгоритама за узрочно откривање и алгоритма претраживања заснованог на СЕМ-у, са нашим графиконом „златног стандарда“. Такође смо истражили разлоге за уобичајене грешке и истражили методе да их спречимо. Ови експерименти су нам омогућили да пружимо смернице за откривање каузалних структура користећи податке посматрања.

Цистанцхе ПревентсАлцхајмерова болест
Позадина
алгоритми за откривање узрочне структуре.Неформално, узрочност се дефинише као однос између две варијабле Кс и И тако да промене у Кс доводе до промена у И8. Кључна разлика између повезаности и узрочности лежи у потенцијалу збуњивања. Претпоставимо да не постоји директна узрочна веза између Кс и И, већ трећа варијабла З узрокује и Кс и И. У овом случају, иако су Кс и И снажно повезани, промена Кс неће довести до промена у И. З се назива цонфоундер. Формалније, узрочност је директан ефекат између А и Б који остаје након прилагођавања за збуњивање. Конфузија може бити уочена или неопажена (латентна).
Узрочна структура је скуп каузалних веза између скупа варијабли, а откривање каузалне структуре је проблем учења узрочне структуре из података опсервације. Наменски алгоритми за откривање узрочне структуре постоје и могу се раздвојити у два подтипа, засновани на ограничењима и на основу резултата. Алгоритми засновани на ограничењима конструишу каузалну структуру засновану на ограничењима условне независности, док алгоритми засновани на резултатима генеришу одређени број каузалних графова кандидата, сваком додељују резултат и бирају коначни граф на основу резултата. У овој студији одабрали смо један истакнути алгоритам из сваког типа: Алгоритам брзог каузалног закључивања (ФЦИ), који је алгоритам заснован на ограничењима, и Фаст Грееди Екуиваленце Сеарцх (ФГЕС), који је алгоритам заснован на резултатима. Ради краткоће, дајемо опис високог нивоа за ФГЕС и ФЦИ. За детаљније описе, упућујемо читаоца на референце 9–11. Обе ове две методе могу да се прилагоде за уочено збуњивање, а један од алгоритама, ФЦИ, има одређену способност да открије латентну конфузију.
брзо узрочно закључивање (фци).Централни концепт иза алгоритма каузалног откривања заснованог на ограничењима је идеја да различите каузалне структуре имплицирају различите односе независности. На пример, узрочна веза А→- Б →Ц, имплицира да је променљива А независна од Ц датог Б. С друге стране, када су А →Ц←Б, А и Б су независни (безусловно), али постају зависни условни на Ц. Ова последња структура се назива "В" структура (такође позната као колајдер) која има јединствен однос независности у поређењу са другим каузалним везама. У ствари, то је један од „примитива“ које тражи алгоритам заснован на ограничењима, као што је ФЦИ.
Карактеристика специфична за ФЦИ чак и међу методама заснованим на ограничењима је његова способност да открије латентне (неопажене) збуњујуће факторе. Ово омогућава још један примитив, "И" структура. Четири варијабле дефинишу "И" структуру када имају следеће узрочне везе: В1 →Кс ← В2 и Кс →И. Унутар структуре „И“, и В1 и В2 су независни од И који је условљен Кс. Ова условна независност помаже да се искључи могућност неизмерене конфузије између Кс и И. Другим речима, када ФЦИ пронађе „И“ структуру у граф, узрочна веза од Кс до И је загарантована непомешан; у супротном, ФЦИ претпоставља да постоје евентуално незапажени збуњујући фактори12.
Алгоритам брзог каузалног закључивања (ФЦИ). ФЦИ конструише каузални граф почевши од потпуно повезаног неусмереног графа и уклања ивице које повезују условно независне променљиве. У другој фази, он оријентише ивице идентификацијом „В“ и „И“ структура и покушава да оријентише преостале ивице на основу скупа правила која су детаљно објашњена на другом месту9,13.
Алгоритам брзе похлепне претраге еквивалентности (ФГЕС).Алгоритам Грееди Екуиваленце Сеарцх (ГЕС) такође има две фазе. Прва фаза почиње са графиком који не садржи ивице (који одговарају свим променљивим које су независне једна од друге) и похлепно додаје ивице (зависности) једну по једну у оријентацији која минимизира Бајесову информацијску оцену14 (БИЦ), што је вероватно кажњено за сложеност како би се смањило прекомерно опремање. ГЕС затим уклања ивице једну по једну све док смањује БИЦ. ФГЕС10 алгоритам који се користи у овом раду је једноставно „брза“ (паралелизована) верзија ГЕС11,15. Слично ФЦИ, ФГЕС се такође ослања на "В" структуре за оријентацију ивица. Подразумевана вероватноћа структуре „В“ је јединствена, док су вероватноће А →Б →Ц, Ц →Б →А и А ←БЦ исте. Тус, ФГЕС ће изабрати "В" структуре када имплицира већу вероватноћу од других структура.
Моделирање структурне једначине (СЕМ).Моделирање структурних једначина (СЕМ) је породица статистичких модела, који, с обзиром на основну узрочну структуру, могу проценити величину ефекта (и друге статистике) сваке везе16. СЕМ такође може предложити модификације дате узрочне структуре како би се побољшала статистика уклапања модела.
Иако СЕМ није дизајниран да открије узрочну структуру, није неуобичајено да се СЕМ-ове предложене модификације користе за „пречишћавање“ структуре графикона. Ова карактеристика се може искористити за итеративно прављење каузалног графа, у свакој итерацији, додајући једну ивицу према предлогу СЕМ-а. Ову (нетачну) методу претраживања имплементирали смо у два сценарија: (1) почевши од празног графикона (Каузално откриће); и (2) почевши од графа добијеног брисањем 1 или 2 ивице из графа „златног стандарда“. Имајте на уму да, у оквиру овог рада, користимо термин „СЕМ“ да представимо алгоритам који користи СЕМ за обављање претраживања ивица, а не за процену величине ефекта.
Кључне разлике између алгоритама. И СЕМ и ФГЕС су постепени алгоритми који модификују структуру додавањем или брисањем ивица. Највећа предност ФГЕС-а је у томе што проширује простор за претрагу трансформацијом тренутне структуре у друге „еквивалентне“ структуре. На пример, с обзиром на ивицу, А →Б се налази у А, Б и Ц графовима. СЕМ ће покушати да дода једну усмерену ивицу између Ц и А или Ц и Б, дајући четири могућности. Међутим, ФГЕС разматра више могућности јер такође може да обрне постојећу ивицу А →Б у А ←Б, дајући четири додатне могуће структуре.
Осим стратегија претраживања (засновано на ограничењу у односу на резултат), ФЦИ се такође разликује од друга два алгоритма по претпоставци о узрочној повезаности: и СЕМ и ФГЕС раде под претпоставком да нема неизмерених збуњујућих фактора. Другим речима, све збуњујуће варијабле се мере у скупу података. ФЦИ, међутим, попушта ову претпоставку и извештава о непомешаном односу само када наиђе на „И“ структуру17.
ФЦИ и ФГЕС алгоритми су имплементирани у софтверском пакету Тетрад (верзија 6.5.4). Слика 1 приказује интерпретације различитих типова ивица у излазном графу. За СЕМ смо користили Р пакет 'лаваан'18.
Метод
Подаци.Подаци коришћени у припреми овог чланка добијени су одАлцхајмерова болестБаза података Неуроимагинг Инитиативе (АДНИ) (адни.лони.усц.еду). АДНИ је покренут 2003. године као јавно-приватно партнерство, на челу са главним истраживачем Мицхаелом В. Веинером, МД. Примарни циљ АДНИ је био да се тестира да ли серијска магнетна резонанца (МРИ), позитронска емисиона томографија (ПЕТ), други биолошки маркери и клиничка и неуропсихолошка процена могу да се комбинују да би се измерило напредовање благог когнитивног оштећења (МЦИ) и раногАлцхајмерова болестболест(АД)19. Постоје три фазе АДНИ студије где је последња, АДНИ3, још увек у току. Сви учесници студије дали су писмени информисани пристанак, а протоколе студије је одобрио институционални одбор за ревизију сваке локалне локације. Све методе су спроведене у складу са релевантним смерницама и прописима. За најновије информације погледајте ввв.адни-инфо.орг. ИРБ преглед није био потребан пошто су АДНИ подаци деидентификовани и јавно доступни за преузимање. Фокусирали смо нашу студију на прва два: АДНИ 1 и АДНИ 2/ГО. Варијабле екстраховане из података су флудеоксиглукоза ПЕТ (ФДГ), амилоид-бета (АБЕТА), фосфориловани тау (ПТАУ), аполипопротеин Е (АПОЕ) ε4 алел; демографске информације: старост, пол, образовање (ЕДУ); и дијагноза на АД (ДКС). Табела 1 представља збирну статистику скупа података. Након уклањања записа са недостајућим вредностима, остало је 1008 учесника са најмање једном комплетном евиденцијом, а 266 са редовном двогодишњом посетом.

графикон „Златни стандард“.Каскада АД биомаркера је широко процењена. Депозиција АБЕТА у мозгу је рани догађај у процесу болести и хвата се кроз смањење АБЕТА ЦСФ-а. Показани фактори ризика за АБЕТА су старост и број АПОЕ4 алела6,20,21. АБЕТА изазива низводно формирање неурофибриларног сплета и последично неуродегенерацију, а оба су заробљена метаболичком дисфункцијом преко ФДГ-ПЕТ22 и повећања ПТАУ мереног на ЦСФ23. Два маркера ФДГ-ПЕТ и ЦСФ ПТАУ су најјачи предиктори когнитивне дисфункције или дијагнозе24,25 (у поређењу са АБЕТА). Образовање, сурогат когнитивне отпорности, утиче на когнитивни статус појединца26. Све су то добро успостављени односи у литератури. Постоје слабије узрочне асоцијације као што је пол који утиче на неке од ових асоцијација које нисмо узели у обзир да бисмо проценили алгоритме јер је утицај ових асоцијација много мањи у поређењу са главним ефектима који се разматрају у графикону „златног стандарда“. Горе описани односи су приказани на слици 2.
Основно знање и подаци о попречном пресеку у односу на лонгитудиналне податке.Да би се ограничили односи које алгоритми могу открити, позадинско знање се може обезбедити у облику ивица које се морају имати или које се не смеју имати (забрањене). У овом раду дефинисали смо три степена основног знања као: (Ниво 1) Без знања: откривена структура искључиво одражава податке; никакве ивице нису забрањене. (Ниво 2) Тривијално основно знање: (а) ивице међу демографским варијаблама су забрањене (иако повезаност између њих може остати) (б) ивице од биомаркера или дијагнозе до демографских варијабли су забрањене. (3. ниво)

Дизајн студија.Студија узрочног открића. Извукли смо два скупа података из АНДИ-ја за овај део студије: један је био један попречни пресек, а подаци су прикупљени током основне посете коју је обавио сваки учесник. Други је лонгитудинални, где смо укључили податке из два пресека: почетне посете и посете извршене током 24 месеца. Записи са недостајућим подацима су уклоњени из даљег проучавања.
Да би се добили чврсти резултати, и попречни и лонгитудинални подаци су 100 пута покренути на нивоу учесника. Десет, три алгоритма, СЕМ, ФЦИ и ФГЕС су тестирани на свим боотстрап узорцима ради евалуације, укључујући три различита степена знања која су описана у претходном одељку.

СЕМ-студија опоравка. Пошто би већина истраживача почела са хипотетизованим графом и користила само СЕМ за додавање ивица, такође смо тестирали СЕМ у оквиру овог претпостављеног случаја употребе: иницијализовали смо (хипотезирали) графове брисањем сваке појединачне ивице и сваког пара ивица са графа „златног стандарда“ , а затим тестирао да ли СЕМ може да поврати избрисане ивице након не више од пет итерација додавања ивица. Изабрали смо пет у овој студији јер ће више од пет пута додавања ивица резултирати графиком са малим памћењем.
метрике евалуације. Да бисмо проценили перформансе метода, дефинисали смо следеће метрике евалуације. Ивица је тачна, ако и само ако иста ивица постоји у графу „златног стандарда“ и оријентација ивице се поклапа са оријентацијом у графу „златног стандарда“; ивица је полуисправна, ако и само ако иста ивица постоји у графу „златног стандарда“ и њена оријентација није у супротности са правом оријентацијом ивице у графу „златног стандарда“; И коначно, ивица је нетачна ако ивица не постоји у графу „златног стандарда“ или ако постоји али је њена оријентација супротна од праве оријентације.
Представићемо следеће метрике:
1. Број исправних, полуисправних, нетачних ивица
2. Прецизност: пропорција тачних или полутачних ивица преко свих ивица које алгоритам наводи
3. Подсетите се: удео ивица у графикону „златног стандарда“ који је тачан или полутачно приказан
4. Стопа појављивања: проценат суседности приказан је у резултату покретања од 100
Резултати
студија узрочног открића. Откривене узрочне структуре генерисане алгоритмима СЕМ, ФЦИ и ФГЕС кроз три степена претходног „знања“ приказане су у овом одељку. Механизам типичних грешака иза сцене биће даље испитан у одељку за дискусију.
Експеримент 1: Без основног знања. На слици 3, представљамо ивице са стопом појављивања од најмање 80 процената у узорцима покретања од 100 (број Те се налази близу сваке ивице). Ивице које нису биле у графу златног стандарда су обојене црвеном бојом. Бројеви на десној страни сваког графикона су прецизност, памћење и број тачних, полутачних и нетачних ивица усредњених у 100 узорцима за покретање. Да би се олакшало директно поређење, варијабле су постављене скоро идентично: иста варијабла заузима исту релативну локацију на сва три графикона. СЕМ је био у могућности да преузме само две исправне ивице са графика „златног стандарда“ (са просечном прецизношћу 0.24 и опозивом 0,30), док су ФЦИ и ФГЕС пронашли 4 од 8 ивица тачно или полутачно (прецизност 0,24 и 0,44, подсетимо се 0,46 и 0,6 респективно). И ФЦИ и ФГЕС су успешно обновили узрочну везу између генетске варијабле АПОЕ41 са АБЕТА, АБЕТА са ФДГ и ФДГ, ПТАУ са ДКС. Међутим, алгоритми нису успели да одреде усмереност неких односа. Такође смо приметили да сва три алгоритма извештавају о ивицама од биомаркера до демографских варијабли које су свакако грешке (нпр. АБЕТА изазива АПОЕ42 у ФЦИ графикону). Важно је напоменути да неки добро успостављени односи као што су старост и амилоид, као и образовање и дијагноза нису откривени ни у једном од графикона који нису имали позадинско знање.
Експеримент 2: Додавање тривијалног основног знања. Слика 4 представља узрочне структуре откривене помоћу три алгоритма који укључују тривијално позадинско знање: демографске варијабле не могу бити узроковане другим демографским варијаблама нити биомаркерима (нпр. на старост учесника не утиче образовање или АБЕТА ниво). Структура слике 4 је аналогна слици 3.
Иако су све методе направиле неколико грешака, дошло је до значајних побољшања када су додане тривијалне позадинске информације. Неки од нетачних узрочно-последичних веза које је пронашао СЕМ су заправо индиректне узрочне везе у „златном стандарду“. На пример, ефекат од АПОЕ42 до ДКС је индиректан ефекат који тече кроз АБЕТА у графикону 'златног стандарда'. Сва три алгоритма су открила ивицу АБЕТА →ДКС. Иако то није директна узрочна последица у нашем графикону „златног стандарда“, АБЕТА је чест узрок смањења ФДГ као и повећања ПТАУ, а и ФДГ и ПТАУ доводе до ДКС. Стога се може очекивати ефекат АБЕТА и ДКС-а. И ФЦИ и ФГЕС су пријавили лажно усмерену ивицу између ПТАУ и ДКС. Видећемо да је ова грешка исправљена коришћењем лонгитудиналних података. ФЦИ алгоритам је такође известио о неизмереним збуњивачима између ПТАУ и ДКС са ФДГ, што су занимљиве хипотезе које захтевају даље студије. Међу три алгоритма, СЕМ је постигао најниже перформансе (Прецизност 0.31, подсећање 0.39), док су ФЦИ и ФГЕС постигли веће и знатно веће перформансе (ФЦИ: 0.42 прецизност и 0.55 опозив; ФГЕС {{10}}.71 прецизност и 0.68 опозив).
Експеримент 3: Додавање лонгитудиналних података и тривијалног основног знања. Слика 5 представља најчешће ивице које су открила три алгоритма и њихове метрике перформанси. Изглед графикона се разликује од претходних слика јер су изграђени на основу лонгитудиналног скупа података. Сви чворови повезани са биомаркерима или дијагнозом се стога појављују двапут: једном са својом основном вредношћу (означено са суфксом „0.0“) и једном након 24 месеца (означено са „0). 24' суфк). Већина статистике је додатно побољшана у односу на претходне резултате и ФГЕС је повратио график са само једном нетачном ивицом.
Перформансе СЕМ алгоритма су заостајале за друга два наменска алгоритма за узрочно откривање. У неким од покретања покретања, СЕМ је пропустио директне ефекте између лонгитудиналних мерења истог биомаркера (нпр. процењена вероватноћа да СЕМ открије ивицу АБЕТА.{{0}} →АБЕТА.24 је 0,47 где је ФЦИ и ФГЕС увек укључује ову ивицу).
ФЦИ алгоритам је даље идентификовао да ПТАУ при почетној посети има утицај на дијагнозу (АД) након 24 месеца. Другим речима, ПТАУ може имати закаснели ефекат на дијагнозу АД, што је врло вероватна хипотеза. Такође смо приметили да СТАРОСТ и ОБРАЗОВАЊЕ доводе до различитих ФДГ и дијагнозе приликом прве посете, али не директно до процене након 24 месеца (након прилагођавања процене при основној посети).
ФГЕС алгоритам је уградио лонгитудиналне податке и успешно открио ивицу ФДГ до ДКС. Такође је уклонио нетачне ивице од ДКС до ПТАУ. Штавише, са лонгитудиналним подацима, претходно неусмерене ивице идентификоване од стране ФГЕС-а су усмерене без угрожавања укупне прецизности и памћења.
С еМ-опоравак студија.Табела 2 приказује статистику када смо тестирали способност СЕМ-а да опорави избрисане ивице са графикона „златног стандарда“. У сваком покретању, избрисали смо једну ивицу или пар ивица. „Стопа потпуног опоравка“ представља проценат покретања у којима је СЕМ успео да у потпуности поврати избрисане ивице(е). Колоне „прецизност“ и „позив“ су дефинисане на исти начин као у претходним експериментима. Као што видимо из табеле 2, када смо уклонили само једну ивицу, стопа опоравка је веома ниска (12,5 процената). Када смо уклонили две ивице са графикона „златног стандарда“, СЕМ није успео да поврати прави графикон.
Дискусија
У овој студији упоредили смо три различите методологије да бисмо поново створили познату узрочну структуру темељне истине на основу скупа података опсервације користећи три различита степена „знања“. Користили смоАлцхајмерова болестподаци из АДНИ-а који је добро окарактерисан отворено доступан скуп података. Пошто су односи међу биомаркерима и дијагноза уАлцхајмерова болестсу добро схваћени, почели смо са каузалном структуром „златног стандарда“ заснованом на постојећој литератури. Десето, применили смо три алгоритма да откријемо ову узрочну структуру из података. Овај рад наглашава уобичајене грешке које праве различити алгоритми и нуди нам идеје и сугестије да избегнемо ове грешке. На крају, дате су детаљне смернице о томе како се алгоритам за каузално откривање може применити да би се откриле висококвалитетне узрочне везе.
Сваки од три алгоритма коришћена у овом раду представља класу алгоритама са својим специфичним карактеристикама. Два алгоритма, ФЦИ и ФГЕС, су наменски алгоритми за каузално откривање, док је трећи, СЕМ, првенствено дизајниран као потврдни алат. Наменски алгоритми за узрочно откривање надмашили су СЕМ у сва три степена основног знања. Ово није изненађујуће, јер СЕМ није посебно дизајниран да открије узрочну структуру; статистика коју је пријавио СЕМ само указује на могућа прилагођавања а приори кориснички дефинисане узрочне структуре. Оно што је изненађујуће је у којој мери је ФГЕС надмашио СЕМ, пошто и ФГЕС и СЕМ оптимизују исти критеријум, а то је БИЦ. Кључна разлика између ФГЕС-а и СЕМ-а је скала основног простора за претрагу: ФГЕС разматра шири низ графова, све графове који имају исту структуру зависности (исти скуп односа условне независности између варијабли). Из експеримента СЕМ-опоравка, такође смо приметили да СЕМ-ови предлози за додавање ивица генерално нису поуздани. Ове ивице могу максимизирати БИЦ у СЕМ-овом ограниченом простору за претрагу, али ово нису свеукупне оптималне ивице: ФГЕС је, са својим већим простором за претрагу, успео да (скоро савршено) поврати график „златног стандарда“.
Пошто ФЦИ и ФГЕС имају сличне просторе за претрагу, главне разлике између њих леже у њиховом алгоритму претраживања. Перформансе алгоритма ФГЕС заснованог на резултату биле су веће и стабилније од алгоритма ФЦИ заснованог на ограничењима у нашој студији. На доношење одлука ФЦИ-ја су утицали нетачни тестови независности уведени пристрасношћу селекције или артефактима података. Ове грешке су се прошириле на друге делове графикона кроз генерисање нетачних „В“ или „И“ структура и на крају су изазвале штету на великим деловима графикона. Насупрот томе, алгоритми засновани на резултатима разматрају вероватноћу глобалне структуре док доносе локалне одлуке; тако да ове грешке остају локализоване. Ово објашњава зашто је откривена структура ФГЕС-а пре или после додавања тривијалног знања конзистентнија. ФЦИ има предност што је у стању да ублажи типичну претпоставку да нема неизмерених збуњујућих фактора. Ово опуштање може бити корисно када је важно или идентификовање неизмерених збуњујућих фактора или финансирање неизмерених узрочно-последичних веза. У нашој студији, ФЦИ је открио да је однос између АБЕТА и ФДГ непомешан и да могу постојати неизмерени збуњујући фактори између ФДГ, ДКС (Слика 4-ФЦИ)
Даље смо истражили грешке које су направили ФЦИ и ФГЕС. Груписали смо ове грешке у три категорије и описали њихове узроке и решења у табели 3.
1. Прва врста грешке се дешава када артефакти у подацима индукују нетачне ивице. На пример, ФЦИ је пријавио предност између ЕДУ и СЕКС (Слика 3-ФЦИ), јер је у нашем узорку просечан ниво образовања мушкараца виши. Избегавање таквих нетачних ивица је важно јер оне потенцијално могу створити нетачне „В“ или „И“ структуре које угрозе преостале кораке каузалног откривања. Додавање тривијалног основног знања може да реши овај проблем спречавањем алгоритама да третирају асоцијацију као узрочност.
2. Када универзално прихваћено основно знање није доступно, компензација артефаката података је тежа и може имати далеке последице. На пример, структура АПОЕ42-ПТАУ-ФДГ је закључена као „В“ структура (АПОЕ42 →ПТАУ ←ФДГ) у неким од покретања покретања. Ова грешка је резултат једне нетачно закључене независности између АПОЕ42 и ФДГ од података узорка. Ова грешка се ширила кроз три асоцијације између (1) АПОЕ42 и ПТАУ, (2) ПТАУ и ФДГ и (3) АПОЕ42 и ФДГ условљене ПТАУ, што је довело до "В" структуре међу три. Не можемо спречити ову ивицу користећи позадинско знање ако претходно не знамо односе условне независности између АПОЕ42 и ФДГ. Коришћење лонгитудиналних података помогло је у исправљању ових грешака; као што можемо видети на слици 5-ФЦИ, подструктура је исправљена када су коришћени лонгитудинални подаци.
3. Док лонгитудинални подаци пружају решење за бројне проблеме, захтев поновљених посматрања може ограничити величину узорка и унети неке сопствене грешке. На пример, ФЦИ је открио могућу заосталу везу између ПТАУ у време 0 и ДКС у месецу 24 (слика 5-ФЦИ), међутим, исти однос није примећен у резултатима из ФГЕС (Сл. 5-ФГЕС) – вероватно због мале величине узорка.
У лонгитудиналној студији, није гарантовано да ће локалне структуре у временским тачкама бити исте. На пример, у графикону који је открио ФГЕС, АБЕТА.{{0}} изазива ПТАУ.0, али АБЕТА.24 не изазива ПТАУ.24. Разлог је тај што је АБЕТА.0 заједнички родитељ АБЕТА.24 и ПТАУ.0. ПТАУ.24 је условно независан од АБЕТА.24 дат је или АБЕТА.{{10}} или ПТАУ.{12}}. Овај однос условне независности имплицира да у присуству АБЕТА.0 или ПТАУ.0, АБЕТА.24 није потребан да би се објаснила варијација у ПТАУ.24.
Иако је коначни графикон научен из података опсервације уско одговарао графикону „златног стандарда“, наши закључци и даље зависе од исправности „златног стандарда“. Генерално, имамо велико поверење у графикон „златног стандарда“, пошто је биолошки механизам иза каскаде АД биомаркера добро схваћен и ФГЕС је успео да открије „златни стандард“ скоро савршено. Међутим, врло је могуће да ФДГ и ПТАУ само објашњавају део ефекта АБЕТА-е на дијагнозу АД; директна узрочност од АБЕТА-е на ДКС-у може постојати. Иако препоручујемо лонгитудиналне податке, прикупљање података уздужно је често скупо, што обично резултира мањом величином узорка. Мала величина узорка смањује статистичку моћ у алгоритму каузалног откривања, што је компромис. Покушали смо да смањимо величину узорка за 50 и 75 процената и спровели исту анализу. Када смо смањили величину узорка за 50 процената, смањен је укупан број откривених ивица у 100 итерација покретања. Међутим, ивице које су доследно откривене на пуном узорку доследно су откривене и на смањеном узорку. Постигли смо сличну прецизност и опозив. Када смо додатно смањили величину узорка (за укупно 75 процената), укупан број ивица је додатно смањен. Док су најчешће откриване ивице наставиле да се откривају, повећао се број „ивица шума“, ивица које су откривене само у неколико итерација покретања.
У закључку, наменски алгоритми за каузално откривање надмашили су СЕМ у откривању узрочне структуре. У анализи података у стварном свету, квалитет података је утицао на исправност откривене структуре. Укључивање претходног знања и коришћење лонгитудиналних података може побољшати откривени резултат спречавањем алгоритама да направе неке потенцијалне грешке.
1. Прва врста грешке се дешава када артефакти у подацима индукују нетачне ивице. На пример, ФЦИ је пријавио предност између ЕДУ и СЕКС (Слика 3-ФЦИ), јер је у нашем узорку просечан ниво образовања мушкараца виши. Избегавање таквих нетачних ивица је важно јер оне потенцијално могу створити нетачне „В“ или „И“ структуре које угрозе преостале кораке каузалног откривања. Додавање тривијалног основног знања може да реши овај проблем спречавањем алгоритама да третирају асоцијацију као узрочност.
2. Када универзално прихваћено основно знање није доступно, компензација артефаката података је тежа и може имати далеке последице. На пример, структура АПОЕ42-ПТАУ-ФДГ је закључена као „В“ структура (АПОЕ42 →ПТАУ ←ФДГ) у неким од покретања покретања. Ова грешка је резултат једне нетачно закључене независности између АПОЕ42 и ФДГ од података узорка. Ова грешка се ширила кроз три асоцијације између (1) АПОЕ42 и ПТАУ, (2) ПТАУ и ФДГ и (3) АПОЕ42 и ФДГ условљене ПТАУ, што је довело до "В" структуре међу три. Не можемо спречити ову ивицу користећи позадинско знање ако претходно не знамо односе условне независности између АПОЕ42 и ФДГ. Коришћење лонгитудиналних података помогло је у исправљању ових грешака; као што можемо видети на слици 5-ФЦИ, подструктура је исправљена када су коришћени лонгитудинални подаци.
3. Док лонгитудинални подаци пружају решење за бројне проблеме, захтев поновљених посматрања може ограничити величину узорка и унети неке сопствене грешке. На пример, ФЦИ је открио могућу заосталу везу између ПТАУ у време 0 и ДКС у месецу 24 (слика 5-ФЦИ), међутим, исти однос није примећен у резултатима из ФГЕС (Сл. 5-ФГЕС) – вероватно због мале величине узорка.
У лонгитудиналној студији, није гарантовано да ће локалне структуре у временским тачкама бити исте. На пример, у графикону који је открио ФГЕС, АБЕТА.{{0}} изазива ПТАУ.0, али АБЕТА.24 не изазива ПТАУ.24. Разлог је тај што је АБЕТА.0 заједнички родитељ АБЕТА.24 и ПТАУ.0. ПТАУ.24 је условно независан од АБЕТА.24 дат је или АБЕТА.{{10}} или ПТАУ.{12}}. Овај однос условне независности имплицира да у присуству АБЕТА.0 или ПТАУ.0, АБЕТА.24 није потребан да би се објаснила варијација у ПТАУ.24.
Иако је коначни графикон научен из података опсервације уско одговарао графикону „златног стандарда“, наши закључци и даље зависе од исправности „златног стандарда“. Генерално, имамо велико поверење у графикон „златног стандарда“, пошто је биолошки механизам иза каскаде АД биомаркера добро схваћен и ФГЕС је успео да открије „златни стандард“ скоро савршено. Међутим, врло је могуће да ФДГ и ПТАУ само објашњавају део ефекта АБЕТА-е на дијагнозу АД; директна узрочност од АБЕТА-е на ДКС-у може постојати. Иако препоручујемо лонгитудиналне податке, прикупљање података уздужно је често скупо, што обично резултира мањом величином узорка. Мала величина узорка смањује статистичку моћ у алгоритму каузалног откривања, што је компромис. Покушали смо да смањимо величину узорка за 50 и 75 процената и спровели исту анализу. Када смо смањили величину узорка за 50 процената, смањен је укупан број откривених ивица у 100 итерација покретања. Међутим, ивице које су доследно откривене на пуном узорку доследно су откривене и на смањеном узорку. Постигли смо сличну прецизност и опозив. Када смо додатно смањили величину узорка (за укупно 75 процената), укупан број ивица је додатно смањен. Док су најчешће откриване ивице наставиле да се откривају, повећао се број „ивица шума“, ивица које су откривене само у неколико итерација покретања.
У закључку, наменски алгоритми за каузално откривање надмашили су СЕМ у откривању узрочне структуре. У анализи података у стварном свету, квалитет података је утицао на исправност откривене структуре. Укључивање претходног знања и коришћење лонгитудиналних података може побољшати откривени резултат спречавањем алгоритама да направе неке потенцијалне грешке.

Референце
1. Беам, АЛ & Кохане, ИС Велики подаци и машинско учење у здравству Велики подаци и машинско учење у здравству Велики подаци и машинско учење у здравству. ЈАМА 319, 1317–1318, хттпс://дои.орг/10.1001/јама.2017.18391 (2018).
2. Мурдоцх, ТБ & Детски, АС Неизбежна примена великих података у здравству Неизбежна примена великих података у здравству. ЈАМА 309, 1351–1352.
3. Тристер, АД, Буист, ДСМ & Лее, ЦИ Да ли ће машинско учење утицати на равнотежу у скринингу рака дојке? Да ли ће машинско учење преокренути равнотежу у скринингу рака дојке? ЈАМА Онкологија 3, 1463–1464.
4. Роџерс, МБ Тере нема сутра за СУТРА. АЛЗФОРУМ.
5. Арванитакис, З. ет ал. Дијабетес је повезан са церебралним инфарктом, али не и са патологијом АД код старијих особа. Неурологија 67, 1960–1965.
6. Вемури, П. ет ал. Старост, васкуларно здравље и биомаркери Алцхајмерове болести у узорку старијих особа. Анн. Неурол. 82, 706–718.
7. Јацк, ЦР Јр. ет ал. Праћење патофизиолошких процеса код Алцхајмерове болести: ажурирани хипотетички модел динамичких биомаркера. Ланцет Неурол. 12, 207–216, хттпс://дои.орг/10.1016/с1474-4422(12)70291-0 (2013).
8. Пеарл, Ј. Узрочност: модели, расуђивање и закључивање. Вол. 64 (Цамбридге Университи Пресс, 2000).
9. Спиртес, П., Меек, Ц. & Рицхардсон, ТС Узрочно закључивање у присуству латентних варијабли и пристрасности селекције. ЦоРР абс/1302.4983 (2013).
10. Рамсеи, ЈД Сцалинг уп похлепне претраге еквивалентности за континуиране варијабле. ЦоРР абс/1507.07749 (2015).
11. Цхицкеринг, ДМ идентификација оптималне структуре уз похлепну претрагу. Јоурнал оф Мацхине Леарнинг Ресеарцх 3, 507–554 (2002).
12. Мани, С., Спиртес, П. & Цоопер, ГФ Теоријска студија И структура за каузално откривање. ЦоРР абс/1206.6853 (2012).
13. Спиртес, П., Цларк, Г. & Сцхеинес, Р. Узрочност, предвиђање и тражење. (Те МИТ Пресс, 2000).
14. Шварц, Г. Процена димензије модела. Тхе Анналс оф Статистицс 6, 461–464.
15. Меек, Ц. Графички модели: одабир узрочних и статистичких модела, (1997).
16. Клајн, РБ Принципи и пракса моделирања структурних једначина, 3. изд. 265–295 (Гуилфорд Пресс, 2011).
17. Хецкерман, Д., Меек, Ц. & Цоопер, Г. Инноватионс ин Мацхине Леарнинг: Тхеори анд Апплицатионс (едс. Давн Е. Холмес & Лакхми Ц. Јаин) 1–28 (Спрингер Берлин Хеиделберг, 2006).
18. Россеел, И. лаваан: Р пакет за моделирање структурних једначина. Јоурнал оф Статистицал Софваре 48, 36, хттпс://дои.орг/10.18637/јсс.в048.и02 (2012).
19. Веинер, МВ ет ал. Утицај Иницијативе за неуроимагинг Алцхајмерове болести, 2004. до 2014. Алцхајмерова болест и деменција: часопис Алцхајмеровог удружења 11, 865–884.
20. Мисхра, С. ет ал. Лонгитудинално снимање мозга код претклиничке Алцхајмерове болести: утицај генотипа АПОЕ епсилон4. Мозак 141, 1828–1839.






