Истраживање самонадзираних трансформатора вида за препознавање хода у дивљини 3. део
Nov 24, 2023
Користимо једноставан упсампле за интерполацију између суседних спојева (слика 3). Међутим, наивно чињење тога на скелету доводи до лажних спојева преко скелета, без обзира на избор формата скелета (нпр. ОпенПосе или ЦОЦО), пошто распоред зглобова не чува никакво семантичко значење.
Секвенцирање зглобова се односи на померање зглобова тела одређеним редоследом. Ова врста вежби игра важну улогу у одржавању физичког здравља и побољшању телесне меморије.
Пре свега, секвенцирање зглобова може промовисати координирано кретање различитих делова тела, повећати снагу мишића и побољшати кардиопулмоналну функцију, што све помаже у одржавању доброг здравља. Истовремено, редовно поравнавање зглобова може смањити укоченост тела и бол, побољшати држање и равнотежу и одложити опадање физичке функције узроковано годинама.
Друго, секвенцирање зглобова такође може побољшати памћење. Истраживања показују да вежбање може стимулисати раст и везе неурона мозга, чиме се промовише размена информација између неурона, што може помоћи у побољшању памћења и способности учења. Редослед кретања зглобова захтева да мозак даје тачна упутства за покрете различитих делова тела, што је од велике помоћи развоју координације и способности памћења мозга.
Коначно, секвенцирање зглобова такође може ублажити стрес и анксиозност и побољшати емоционалну стабилност. Вежбање може да ослободи неке супстанце у телу, као што су допамин и ендорфини, који могу помоћи у ублажавању емоционалних проблема и побољшању осећаја среће и задовољства у телу. Ови фактори такође имају позитиван утицај на побољшање памћења.
Укратко, постоји позитивна веза између заједничког секвенцирања и памћења. Кроз редовне вежбе секвенцирања зглобова, можете промовисати здрав развој тела и мозга, побољшати памћење и способности учења и побољшати емоционалну стабилност. Обратимо пажњу на добро здравље и уживајмо заједно у лепоти живота! Види се да морамо побољшати памћење, а цистанцхе десертицола може значајно побољшати памћење јер је цистанцхе десертицола традиционални кинески медицински материјал који има много јединствених ефеката, од којих је једно побољшање памћења. Ефикасност млевеног меса потиче од различитих активних састојака које садржи, укључујући киселину, полисахариде, флавоноиде, итд. Ови састојци могу да унапреде здравље мозга на различите начине.

Кликните на суплементе да бисте побољшали памћење
Ово запажање је у складу са радом Ианг ет ал. [44], који предлаже слику скелета структуре дрвета (ТССИ) да би предложио просторне односе између зглобова. Заснован је на редоследу преласка стабла у дубину на зглобовима, који чува структурне информације скелета. Слика 3 (десно), приказује ефекте различитих формата скелета и метода упсампле. За ову методу промене величине користили смо ТССИ формат и бикубну интерполацију.
Штавише, експериментисали смо са две методе повећања, које су се могле научити током обуке. Користили смо једноставан линеарни слој нанет на сваки спљоштени скелет да бисмо повећали број зглобова. Ово је најједноставнији начин да се трансформише сваки скелет, али не узима у обзир никакве просторне односе између зглобова. Да бисмо ово решили, такође користимо скуп 2Д деконволуционих слојева на скелетној секвенци за промену величине, узимајући у обзир и структурне информације; за ову методу користимо и ТССИ формат.
Табела 1 приказује резултате за сваки метод промене величине за све архитектуре. Модели су обучавани и процењени на ЦАСИА-Б током 200 епоха, а ми показујемо резултате за нормално ходање. За остатак наших експеримената, одлучили смо да повећамо узорковање секвенце скелета бикубичном интерполацијом.


Иако постоји неколико могућих самоконтролисаних процедура пре тренинга, ми смо се определили за контрастни приступ пре тренинга јер је то исти поступак за стварни задатак проналажења препознавања хода. Контрастивни приступи подстичу представе које припадају истој класи да буду блиске у латентном простору, док су истовремено удаљене од представа које припадају различитим класама.
Конкретно, користимо Супервисед Цонтрастиве [45] за претренинг. Губитак СупЦон-а функционише на групи са више прегледа: сваки узорак у серији има вишеструке проширене верзије самог себе. Показало се да је природно робусније оштећење података, ублажава потребу за пажљивим одабиром тројки јер градијент подстиче учење из тешких примера и мање је осетљив на хиперпараметре.

3.4. Дата Аугментатион
Обука на контрастиван начин са самонадзором са губитком СупЦон подразумева употребу повећања података да би се обезбедило вишеструко проширене „прегледе“ исте секвенце скелета. Повећања која се користе за наше секвенце ходајућег скелета су у складу са другим радовима у овој области [10,12, 30]. Главно коришћено увећање је насумично временско исецање са дужином периода од Т=64 оквира.
С обзиром на то да се скелети прате променљиво временско трајање, користимо опсецање да бисмо осигурали да све секвенце имају исту дужину. Штавише, особа која хода може променити правац и извршити друге радње током праћеног трајања; сходно томе, обрезивање изазива већу варијабилност за исту секвенцу.
Штавише, мењамо темпо ходања успоравањем или убрзавањем хода. Користили смо модификаторе брзине {{{0}}.5, 0.75, 1, 1.25, 1.5, 1.75, 2.0}. Ово је прилагођено из рада Ванг ет ал. [48] за самоконтролисано учење видео репрезентација. Штавише, модификација пејсом је коришћена у анализи хода у прошлости [33].
Такође користимо насумично окретање са вероватноћом {{0}}}.5, преокрет секвенце са вероватноћом од 0.5, адитивни Гаусов шум за сваки спој са σ=0.005, и насумично испадање од 5% зглобова са вероватноћом од 0,01 за симулацију недостајућих зглобова из модела посеестимације.

3.5. Методе иницијализације
Да бисмо измерили утицај перформанси самонадгледаног претходног тренинга на предложене архитектуре, истражујемо три различите методе иницијализације. Табела 2 приказује различите скупове података који се користе у литератури. Док су ЦАСИА-Б [6] и ФВГ[29] контролисани скупови података, који се углавном користе за евалуацију, ми користимо ДенсеГаит [12] и ГРЕВ [7] за самоконтролисану претходну обуку за пет архитектура. ДенсеГаит и ГРЕВ су две од највећих реалистичких база података о ходању, прикупљене на отвореном, које вероватно садрже већину варијација хода, понашања и сложености присутних у свакодневном животу. Ми бирамо ове скупове података да би имали општије репрезентације хода, да бисмо омогућили аутентификацију хода у општим сценаријима надзора.

ДенсеГаит Претренинг ДенсеГаит је скуп података о ходу великих размера „у дивљини“ који се аутоматски прикупља из токова надзора. Садржи 217 К праћених секвенци скелета, екстрахованих помоћу АлпхаПосе [22], у различитим окружењима и угловима камере са више географских локација. Пошто се ДенсеГаит прикупља аутоматски, његове напомене у смислу идентификатора праћења су бучне, а скуп података може да садржи секвенце о истој теми, иако је то ретка појава. Међутим, ово је случај за већину великих неозначених скупова података који садрже узорке који припадају истој семантичкој класи, што се сматра неповезаним током обуке. Сваку архитектуру унапред обучавамо на ДенсеГаит-у и користимо обучене параметре за даљу процену перформанси контролисаних скупова података.
ГРЕВ Претренинг ГРЕВ је још један скуп података „у дивљини“ на отвореном, али је пажљиво обележен тако да садржи субјекте који ходају током више дана и различите врсте одеће. Међутим, да бисмо били у складу са захтевима режима самонадгледања, одбацимо напомене и третирамо сваки низ хода као засебну особу. ГРЕВ је 2× мањи од ДенсеГаит-а, који садржи 128 К секвенци скелета, док се сваки пешак прати током краћег просечног трајања [12]. Такође обучавамо сваку архитектуру на ГРЕВ-у и користимо обучене параметре за процену перформанси у наставку.
Насумична иницијализација Овај метод иницијализације не одговара претходној обуци (тј. обуци од нуле). Свака архитектура се обучава са насумичном иницијализацијом тежине на низводним скуповима података. Овај метод је основа за поређење побољшања перформанси претходном обуком.
3.6. Евалуација
Учинак низводног задатка се оцењује на два различита начина за препознавање хода. Директно тестирамо могућности преузимања унапред обучених архитектура, без финог подешавања за одређени задатак. Овај метод одговара нултом трансферу. Даље, фино подесимо сваку архитектуру користећи 10× мању стопу учења него током претренинга, са прогресивно мањом стопом учења на почетку мреже, што одговара политици опадања брзине учења у слојевима (ЛЛРД) [50].
Процена перформанси низводно се врши на два популарна скупа података за препознавање хода: ЦАСИА-Б [6] и ФВГ [29]. Оба скупа података садрже мали број субјеката под строгим протоколима ходања, који се контролишу на основу различитих збуњујућих фактора: угла камере, одеће, прибора и брзине хода.
ЦАСИА-Б је скуп података за затворене просторе који садржи 124 субјекта снимљених са 11 синхронизованих камера. Сваки појединац хода у три различита услова: нормално ходање, промена одеће и ношење торбе. Од свог објављивања, он је био главна компонента за бенцхмаркинг модела гаитанализе, као један од најчешће коришћених скупова података у овој области. Користимо прва 62 предмета као сет за обуку, а остатак од 62 за евалуацију учинка. За препознавање хода, бирамо да процењујемо перформансе по угловима у поставци „изостави једно напољу“, у којој скуп галерије садржи све углове хода осим угла сонде.
Фронт-Виев Гаит је још један популаран скуп података за препознавање хода, који има 226 субјеката који ходају на отвореном под различитим протоколима. За разлику од ЦАСИА-Б, ФВГ карактерише додатне збуњујуће факторе: брзину хода, претрпану позадину и проток времена (тј. неки субјекти имају регистроване шетње које трају годину дана). Штавише, сви субјекти су снимљени углом предње камере, који се сматра најтежим углом за препознавање хода јер садржи најмању количину уочених варијација покрета зглобова. Првих 136 предмета користили смо за обуку, а остале за евалуацију рада. Евалуација перформанси за препознавање хода се придржава протокола које су уцртали аутори, у којима користимо нормалну секвенцу ходања у скупу галерије и друге услове у скупу сонде.

За све сценарије евалуације користимо детерминистичко изрезивање у центру низа хода и не користимо никаква повећања времена тестирања.
4. Експерименти и резултати
4.1. Евалуација ЦАСИА-Б
Сваку архитектуру унапред обучавамо на ДенсеГаит-у и ГРЕВ-у и оцењујемо перформансе на ЦАСИА-Б и ФВГ-у. У првом сету експеримената, заинтересовани смо за процену перформанси ЦАСИА-Б у сценарију финог подешавања након претходног тренинга, са прогресивно већим узорцима за обуку. Обучили смо сваку мрежу за прва 62 идентитета, са свим доступним варијацијама ходања, а остале смо задржали за тестирање. Процена препознавања је извршена коришћењем прва 4 нормална узорка за ходање као галеријског скупа, а остала као сет сонде. Слика 4 приказује тачност за сваку од три варијације ходања (нормално—НМ, одећа—ЦЛм и торба за ношење—БГ) за ЦАСИА-Б. За овај сценарио, насумично смо узорковали К={1, 2, 3, 5, 7, 10} хода по субјекту, по углу и обучили модел. Иако су перформансе релативно сличне између архитектура, јасно је да претренинг нуди значајно повећање перформанси у поређењу са насумичном иницијализацијом, без обзира на избор скупа података пре обуке.
Штавише, чини се да СимплеВиТ, ЦроссФормер и Твинс-СВТ имају сличне високе перформансе, док Токен2Токен мало заостаје. Ово сугерише да метода прогресивне токенизације која се користи у Токен2Токену, која је посебно дизајнирана за структуре налик на слику, не обухвата ефективно карактеристике низова хода. Постоји приметна разлика између скупова података пре обуке: чини се да ДенсеГаитс нуди доследно повећање перформанси у две варијације ходања (ЦЛ и БГ) у поређењу са ГРЕВ. Ово указује на чињеницу да ДенсеГаит укључује изазовније и реалније сценарије који боље припремају модел за услове у којима на образац ходања утичу спољашњи фактори.



Архитектуре су обучене да мапирају секвенце ходања у простор за уграђивање, где близина између тачака одражава сличност одговарајућих секвенци ходања. То значи да уградње невидљивих секвенци хода из истог идентитета треба да буду блиске једна другој у простору уградње и формирају кластере, док би уградње различитих идентитета требало да буду удаљеније једна од друге и формирају различите кластере. Ово је важно јер омогућава моделу да генерализује невидљиве секвенце хода и прецизно идентификује појединца коришћењем приступа најближег суседа. На слици 5, представљамо груписање за уградње за сваки идентитет у скупу тестова смањења димензионалности ЦАСИА-Бафтер са т-СНЕ [51]. Користили смо 256-димензионални вектор за уграђивање и пројектовали га у две димензије. Чини се да СимплеВиТ и ЦроссФормер имају најбоље раздвајање идентитета, без обзира на угао гледања камере.

4.2. Евалуација ФВГ
Слично томе, проценили смо перформансе сваке архитектуре на ФВГ-у, која се квалитативно разликује од ЦАСИА-Б, јер садржи само један угао гледања. Фино подешавамо унапред обучену мрежу на разломку ф={0.1, 0.2, 0.3, {{10 }}.5, 0.7, 1.0} од 12 трчања особа у сету за обуку. Резултати финог подешавања су представљени на слици 6. Резултати прате сличан тренд као и за ЦАСИА-Б: СимплеВиТ и ЦроссФормер имају константно високе перформансе, а употреба скупа података за претходну обуку је корисна за ниже перформансе. Даље, чини се да претходна обука на ДенсеГаит-у наставља са сталним побољшањем тачности. Као што су приметили Цосма и Радои [12], ДенсеГаит садржи субјекте који се прате дуже време, и то пружа више варијација у контрастивном циљу учења, слично као код насумичног исецања за самоконтролисану преттренинг за природне слике. Слично резултатима на ЦАСИА-Б, варијација одеће значајно заостаје за уобичајеним сценаријем ходања.
У табели 4 представљамо детаљније резултате на тестном скупу ФВГ између претходно обучених модела, слично сценарију ЦАСИА-Б. Резултати пре тренинга су конзистентни: претходна обука на ДенсеГаит-у директно корелира са побољшањем тачности низводно. Док претходна обука на оба скупа података побољшава перформансе у свим сценаријима, побољшање је посебно значајно у сценарију ЦБГ (затрпана позадина) који се обично састоји од више људи у видеу, слично ономе што би се очекивало у реалним поставкама. Ово побољшање вероватно долази из чињенице да су ДенсеГаит и ГРЕВ били окупљени у природним, неконтролисаним окружењима, што их чини реалнијим и изазовнијим, чиме се боље припрема модел за сличне услове као у ЦБГ сценарију. Рангирање између модела је слично ЦАСИА-Б: СимплеВиТ, ЦроссФормер и Твинс-СВТ доследно надмашују ЦаиТ и Токен2Токен. И за ЦАСИА-Б и за ФВГ, ЦаиТ мало заостаје за другим моделима.

4.3. Тест просторно-временске осетљивости
Једна посебност трансформатора вида је произвољан избор димензија закрпа, што се може показати као пресудно у коначној изведби. У случају обраде слике, димензије закрпе нису посебно важне, због транслационе инваријантности семантичког садржаја у слици.
За скелетне секвенце, међутим, димензије закрпа одговарају специфичним и интерпретабилним карактеристикама улаза: висина закрпе представља количину просторних информација садржаних у закрпи (тј. број укључених скелетних зглобова), док временске димензије представљају количину укључених временских информација ( односно број оквира). Баланс између њих треба пажљиво размотрити у коришћењу прилагођених трансформатора вида за анализу хода. На слици 7, приказујемо топлотну мапу у којој свака ћелија представља перформансе обученог модела (насумично иницијализованог) на ЦАСИА-Б за нормално ходање. Обучавамо сваки модел током 50 епоха за фер поређење и мерење брзине конвергенције у фиксном броју корака.
Направили смо две топлотне мапе, једну за СимплеВиТ и једну за ЦаиТ пошто имају сличну основну кичму, и једноставно је изменити величине закрпа. Исти процес се може извести и за друге тестиране архитектуре. Закључујемо да мање величине закрпа одговарају позитивном повећању перформанси моделирања за скелетне секвенце, док компромис између просторних и временских димензија није пресудан, пошто су перформансе сличне - матрица топлотне карте је прилично симетрична по другој дијагонали. Према томе, мање квадратне величине закрпа као што је (2, 4) у просторним и временским димензијама најбоље одговарају овом задатку, док веће величине закрпа као што је (32, 32) садрже премало дискриминативних информација. Међутим, мања величина закрпе једноставно повећава број закрпа, што захтева више рачунарске снаге. За наше подешавање два НВИДИА РТКС 3060 ГПУ-а, пријавили смо грешке у недостатку меморије за неке комбинације мањих величина закрпе.

Највероватнији разлог за побољшане перформансе са мањим величинама закрпа је тај што архитектура може боље да ухвати сложеност шаблона хода израчунавањем сложенијих интеракција између закрпа. Закрпе са највећим могућим просторним величинама и најмањим могућим временским величинама могу се сматрати потпуним приказом скелета, док закрпе са највећим могућим временским величинама и најмањим могућим просторним величинама обухватају целину покрета појединачног зглоба. Као што се може приметити, највећа прецизност се постиже када величина закрпа укључује баланс и просторних и временских информација, које одговарају малим покретима блиско повезаних зглобова.
5. Дискусија и закључци
У овом раду дали смо свеобухватну процену пет популарних варијанти трансформатора вида прилагођених за обраду скелетних секвенци. Наши напори су у складу са недавним напретком у дубоком учењу да суштински ујединимо различите модалитете у оквиру архитектуре трансформатора. Предложили смо методу просторног повећања узорковања за скелете (бицубицупсамплинг са ТССИ скелет форматом) да би се вештачки повећао број спојева, тако да секвенца може бити правилно конзумирана од стране енкодера трансформатора. Штавише, свака архитектура је обучена у оквиру парадигме обуке самонадзора на два општа и велика скупа података о ходу (тј. ДенсеГаит и ГРЕВ), а затим је процењена на два скупа података за препознавање хода у контролисаним окружењима (тј. ЦАСИА-Б и ФВГ). Одлучили смо да усвојимо парадигму учења са самонадзором да бисмо добили опште карактеристике хода, неограничене на одређену варијацију ходања или гледиште камере.
Наши резултати указују на потребу за великом количином, високим квалитетом и разноврсним скуповима података за моделе анализе хода пре тренинга. Показали смо да претренинг на ДенсеГаит-у нуди конзистентна побољшања тачности у односу на ГРЕВ, због повећања величине, броја варијација и просечног трајања хода [12]. Најзначајнија корист је, међутим, у ситуацијама са малим количинама доступних података о обуци. Наши резултати показују да обука од нуле доводи до знатно лошијих резултата од финог подешавања чак и са скромним количинама података (тј. 10 секвенци по особи). Тренутно се већина приступа ходању изводи у затвореном простору у строго контролисаном окружењу, које се не може генерализовати на сложеност интеракција у стварном свету. Различити скупови података о обуци су кључни за извођење прецизне анализе понашања у дивљини, посебно зато што је ход биометријска карактеристика на коју лако утичу спољни фактори околине, као и унутрашње и емоционалне компоненте.

Наша студија аблације показује да су мање просторно-временске закрпе корисне за боље резултате низводно. Овај увид даје информације о будућем развоју секвенци форскелета архитектуре, које су се раније ослањале на обраду појединачног скелета на једној закрпи [12].
Поред истовремених напора да се анализа хода доведе у реална окружења, наш даљи рад омогућава прелазак аутентификације хода и анализе понашања из затвореног, контролисаног окружења у окружење у стварном свету. Препознавање хода у дивљини ће постати свеприсутно са развојем паметних сензора и ефикасних неуронских архитектура које обрађују понашање вођено покретом у реалном времену.


Референце
1. Киеонг, С.; Ким, СМ; Јунг, С.; Ким, ДХ Анализа обрасца хода и идентификација клиничке подгрупе: ретроспективна опсервациона студија. Медицина 2020, 99, е19555. [ЦроссРеф] [ПубМед]
2. Мицхалак, Ј.; Троје, НФ; Фисцхер, Ј.; Воллмар, П.; Хеиденреицх, Т.; Сцхулте, Д. Отелотворење туге и депресије — обрасци ходања повезани са дисфоричним расположењем. Психосом. Мед. 2009, 71, 580–587. [ЦроссРеф] [ПубМед]
3. Виллемс, ТМ; Витвроув, Е.; Де Цоцк, А.; Де Цлерцк, Д. Фактори ризика у вези са ходом за бол у доњем делу ногу повезан са вежбањем током трчања. Мед. Сци. Спортс Екерц. 2007, 39, 330–339. [ЦроссРеф] [ПубМед]
4. Сингх, ЈП; Јаин, С.; Арора, С.; Сингх, УП Препознавање хода засновано на визији: анкета. ИЕЕЕ Аццесс 2018, 6, 70497–70527. [ЦроссРеф]
5. Макихара, И.; Никон, МС; Иаги, И. Препознавање хода: базе података, репрезентације и апликације. Рачун. Вис. Реф. Водич 2020,1–13.
6. Иу, С.; Тан, Д.; Тан, Т. Оквир за процену утицаја угла гледања, одеће и стања ношења на препознавање хода. У Зборнику радова 18. међународне конференције о препознавању узорака (ИЦПР'06), Хонг Конг, Кина, 20–24. август 2006; свеска 4, стр. 441–444.
7. Зху, З.; Гуо, Кс.; Ианг, Т.; Хуанг, Ј.; Денг, Ј.; Хуанг, Г.; Ду, Д.; Лу, Ј.; Зхоу, Ј. Препознавање хода у дивљини: Репер. ИнПроцеедингс оф тхе ИЕЕЕ Интернатионал Цонференце он Цомпутер Висион (ИЦЦВ), Монтреал, БЦ, Канада, 11–17. октобар 2021.
8. Цхао, Х.; Хе, И.; Зханг, Ј.; Фенг, Ј. Гаитсет: О ходу као скупу за препознавање хода у унакрсном погледу. У Процеедингс оф тхе АААИЦонференце он Артифициал Интеллигенце, Хонолулу, ХИ, САД, 27. јануар–1. фебруар 2019.; Том 33, стр. 8126–8133.
9. Фан, Ц.; Пенг, И.; Цао, Ц.; Лиу, Кс.; Хоу, С.; Цхи, Ј.; Хуанг, И.; Ли, К.; Хе, З. Гаитпарт: Темпорал парт-басед модел за препознавање хода. У Процеедингс оф тхе ИЕЕЕ/ЦВФ Цонференце он Цомпутер Висион анд Паттерн Рецогнитион, Сеаттле, ВА, УСА, 13–19 јун 2020; стр. 14225–14233.
10. Цосма, А.; Радои, ИЕ ВилдГаит: Учење репрезентација хода из сирових токова надзора. Сензори 2021, 21, 8387. [ЦроссРеф][ПубМед]
For more information:1950477648nn@gmail.com






