1 (edited by enchoj 19.03.2014г. 16:07:04)

Topic: Correlation and causation

Здравейте!
Имам един въпрос, на който ми е интересно да чуя мнението на професионални фолософи.
Може би знаете, че логическата база на регресионния и корелационния анализ е един принцип, формулиран от английския философ Джон Стюърт Мил през 18-ти век:
"Ако едно явление варира по същия начин, както варира друго явление, то първото или е причина за второто, или резултат от него, или двете са свързани с причинно-следствена връзка. Това може да се прочете и тук (на втората страница):

http://mres.gmu.edu/readings/PSYC557/Ro … lation.pdf

От друга страна, всички статистици твърдят, че корелацията, която е не нещо друго, а метод за измерване на степента на сходство между вариациите на два признака, не означавала причинно-следственост. Дори има такъв израз в уикипедията:

http://en.wikipedia.org/wiki/Correlatio … _causation

Тогава, или принципът на Мил не е верен, или статистиците някъде бъркат.

Как бихте го обяснили?

Re: Correlation and causation

"...is connected with it through some fact of causation."

Да пробваме буквално: Две явления са свързани чрез „някакъв факт на причиняване“. Може да имат обща причина (без едното да причинява другото). Може да имат различни причини, които да имат обща причина само при наличието на някакво съвсем друго условие, което въобще не е очевидно свързано с първоначално разглежданите явления. И т.н.

Накратко, ако имаме корелация (отношението във флуктуациите не е напълно случайно, произволно), то имаме някаква каузалност (причиняване), но не е задължително причиняването да е пряка връзка между едното и другото явление. Прочетете изреченията, които следват цитата от Мил.

Re: Correlation and causation

Прав сте.
А според Вас, как стоят нещата, ако явленията се проявяват не при една двойка случайни променливи, а при много такива двойки?
Имам предвид, ако една двойка променливи варириат по сходен начин, това може да се дължи на зависимост между тях, но може и да се дължи на това, че и двете зависят от трета променлива.
Обаче, ако множество променливи величини варират по сходни начини с друго множество променливи, и тези сходни начини са общо взето сходни помежду си, според мен, можем с голяма степен на увереност да кажем, че съществува причинно-следствена връзка между признаците, по които тези две двойки множества променливи варират, а не зависимост от трети признак. Защото е малко вероятно, трети фактор да влияе по един и същ начин на сходството на вариациите при всички двойки променливи.
Прав ли съм?

Re: Correlation and causation

Ами не знам дали сте прав.

Принципният риск при спекулативното статистициране е да се подцени теорията, същностното разбиране за разглеждания обект. За да изолирате причиняването трябва да гарантирате статичност на всичко останало, но обикновено кое е това „всичко останало“ почти винаги стои в предразсъдъка, обратното означава нещо като изчерпателно математическо описание на действителността -- в общия случай непосилна задача.

Това, което описвате, съдържа толкова много мъгляви граници и приближения, че няма как да сте прав или да не сте прав. Зависи.

Ако запълните тези абстракции с нещо конкретно, може да стане по-интересно и обозримо.

Re: Correlation and causation

ОК.
Ще се опитам да бъда по-конкретен, но трябва да започна от по-далеч.
Имам една идея за измерването и изобщо - за начина на проявление на зависимостите между статистическите признаци, която тотално се различава от традиционния корелационен и регресионен анализ и на практика напълно го опровергава. Тази идея, колкото и да звучи самонадеяно, е много по-логична и вярна от традиционната представа за зависимостите между признаците, която господства в статистиката от Пирсън насам.
В статистическата теория регресионният и корелационен анализ се смятат за толкова добре обосновани от математическа гледна точка, че едно твърдение, че може да са погрешни, звучи направо като ерес.
Истината обаче е, че не регресионният и корелационен анализ са математически обосновани, а тяхната математическа основа - методът на най-малките квадрати.
Този метод е създаден от Гаус и като всяко нещо, измислено от него, е брилянтен.
Обаче Гаус е създал метода на най-малките квадрати, за да определи траекторията на един астероид. Едва ли би му хрумнало да го използва по начина, по който тази метод се използва в регресионния и корелационен анализ.
Изложих моята идея в една статия и сега се опитвам да я публикувам.
Най-напред я показах на един професор по математика и той ми предложи да я публикува в някакво издание на Руската академия на науките, но поиска да я

Re: Correlation and causation

мисля си: нмк са критерий за оценка на някакъв модел, който съответно е и оптимален; с друг критерий - друг оптимален модел (примерно друга четна функция (eg. abs(x)) вместо квадрат). нмк се връзват добре с гаусово разпределение на очаквани отклонения, което е правдоподобно, ако разните фактори са прилично разпределени, но това съвсем не е винаги гарантирано.

Re: Correlation and causation

Вярно е, че не винаги сме сигурни дали стойностите на признаците са нормално разпределени, но не това е проблемът, който имам предвид. Проблемът е изобщо в погрешното разбиране на проявлението на зависимостите между признаците.
Ето един елементарен пример, който използвам и в статията си:
Представете си, че имате няколко варианта на стойностите на два признака за няколко единици от една съвкупност. Например - четири варианта на стойностите на продължителността на трудовия стаж и дневната производителност на труда на четирима работници:

       Вариант 1           Вариант 2             Вариант 3              Вариант 4
Стаж     Произв.       Стаж     Произв.    Стаж       Произв.    Стаж        Произв.   
10         145                11        130          12          115           13         100
12         165                13        150          14          135           15         120
14         185                15        170          16          155           17         140
16         205                17        190          18          175           19         160

Re: Correlation and causation

Извинявайте за вида на таблицата, но тук е трудно да се направи по-добра.
Ако изчислим регресионните коефициенти в четирите варианта на примера, ще видим, че всички те са равни на 10. Коефициентите на линейна корелация и детерминация също са равни - на 1-ца.
Това, според регресионния и корелационен анализ означава, че и в четирите варианта зависимостта на производителността на труда от трудовия стаж на четиримата работници е абсолютна положителна, като увеличението на стажа с една година, води до увеличение на дневната производителност с 10 единици.

9 (edited by enchoj 24.03.2014г. 11:14:09)

Re: Correlation and causation

Ако обаче Ви кажа, че числата в таблицата представляват стойностите на продължителността на стажа и производителността на труда на едни и същи работници в четири последователни години, т.е.:

      2010г.                      2011г.                      2012г.                    2013г.
Стаж     Произв.       Стаж     Произв.    Стаж       Произв.    Стаж        Произв.   
10         145                11        130          12          115           13         100
12         165                13        150          14          135           15         120
14         185                15        170          16          155           17         140
16         205                17        190          18          175           19         160

Как мислите, дали някой ще Ви повярва, че има положителна зависимост на производителността на труда от продължителността на стажа? При това - абсолютна положителна зависимост?

Re: Correlation and causation

Интересна тема! Накратко и от мен.

Мил е емпирицист, радикален. Емпирицизмът е водещата доктрина на съвременната наука. С две изключения. Чиста математика и логика. Традиционно, каузалността се приема само в научен дискурс. Според accepted view причинност може да има само във ... Физически свят, където важат закони, които могат а) да опишат коректно причинността, като явление и б), които могат да я обяснят. Всичко, което не е от/в физически свят не може да се ползва от подобни обяснения. Та, чистата математика във всичките й дялове, и по силата на същата научна семантика, която работи в споменатата наука, не е позиционирана като домейн на съществуване във физическия свят. Нейните елементи са абстрактни, и по дефиниция каузално инертни. Та, това е един от най-големите проблеми в съвременната философия на математиката и не само. Как става така, че имаме математически истини (като статистическите такива), които да са верни в и за физическия свят. Защото науката има доста добра история за чисти физически причини и ефекти но има нула такива за абстрактни истини за неабстрактни феномени. Най-красиво и влиятелно това е описано от Уигнър в статията му "The unreasonable effectiveness of mathematics in the natural sciences". Hope this sheds some light.

… the answer is, in essence, that during this century of science’s greatest achievements, most physicists and philosophers have given  up on the idea that the purpose of science is to discover how the world really is. Instead they want to regard it as a mere instrument for making predictions and achieving pragmatic goals.
   
www.sofiafilm.com

Re: Correlation and causation

Как става така, че имаме математически истини (като статистическите такива), които да са верни в и за физическия свят.

То, в примера, който дадох, се оказва нещо повече - че имаме две противоположни математически истини, като и двете са напълно верни.
Ако изчисляваме коефициентите на корелация и регресия за отделните години, получаваме, че и за четирите години, корелацията е пълна положителна. Ако ги изчисляваме за отделните работници, получаваме, че и за четиримата работници е пълна отрицателна.
Обаче, въпросът е: каква е зависимостта на производителността от трудовия стаж през периода 2010г. - 2013г. и е абсурдно да твърдим, че има две противоположни зависимости между тези два признака. При това - и двете абсолютни.
Всъщност, оказва се, че числата в таблицата имат две двойки групи от по 4 средни (една по години и една по работници) и ако прилагаме принципа на Мил излиза, че има и две групи съответствия на отклоненията от тези средни - едната положителни, а другата отрицателни.
Това разбира се, е абсурд и за да се разгадае този абсурд, трябва да се види около коя от двете групи средни наистина варират стойностите на двата признака.

12 (edited by enchoj 28.03.2014г. 13:06:46)

Re: Correlation and causation

Ето един пример за анализ на зависимостта между два признака, в случая - на индекса на корупция от БВП на човек от населението.

http://www.creativeclass.com/_v3/creati … ionGDP.png

Общата идея е, че колкото са по-близо точките с координати - стойностите на двата признака до регресионната права, толкова по-близка е емпиричната зависимост до теоретичната. Наклонът на регресионната права пък показва степента на влияние на БВП върху индекса на корупция.
Това, както казахме, тръгва от принципа на Мил и ако стойностите на двата признака варират напълно еднакво - точките ще лежат върху правата. Колкото по-различно варират тези стойности, толкова по-отдалечени ще са точките от правата.
Въпросът е обаче, дали стойностите на признаците варират така както си го представят регресионният и корелационен анализ?
Според тези анализи, стойностите на двата признака за различните държави варират около някакви общи за всички държави средни - среден БВП и среден индекс на корупция.
Дали е така, обаче...

13 (edited by enchoj 28.03.2014г. 16:36:45)

Re: Correlation and causation

Ако това беше вярно, това би означавало, че ако проследим двата признака в няколко последователни години, то БВП на Таджикистан би получавал стойности, които са общо взето по равно разпределени под и над средния БВП за всички държави. Същото се отнася и за индекса на корупция на Таджикистан. Това би означавало, че в поредицата от години, точката на Таджикистан, която на тази графика е в долния ляв ъгъл, ще бъде ту в този ъгъл, ту горе в дясно при Швеция и Норвегия, ту някъде в средата при Турция и Перу - изобщо, ще се отклонява от правата ту в едната, ту в другата посока.
Разбира се, това би трябвало да се отнася не само за точката на Таджикистан, но и за точките на всички останали държави - в поредицата от години да приемат различни местоположения в "елипсата" от точки.
Тогава, наистина би имало смисъл да търсим съответствието между вариациите на стойностите на двата признака около техните общи средни.

14 (edited by enchoj 28.03.2014г. 13:09:32)

Re: Correlation and causation

Мисля, че няма смисъл да ви убеждавам, че ако вземем данните за няколко последователни години, точките на държавите изобщо няма да имат такова поведение.
Мога да се обзаложа с всеки, че точката на Таджикистан ще се мести, но ще бъде все в долния ляв ъгъл, а точките на Швеция и Норвегия - все в горния десен ъгъл.
Причината е в това, че стойностите на двата признака на различните държави не варират, както приемат регресионния и корелационен анализ, около една обща средна, а около индивидуални за всяка държава средни.
Оттам, те не се отклоняват от една обща регресионна права, а около множество индивидуални регресионни прави.
Наистина, когато наблюдаваме стойностите на двата признака само за една година, няма как да забележим тези индивидуални средни и инидвидуални прави. Това обаче изобщо не означава, че те не съществуват - защото зависимостта между признаците се проявява не в един-единствен момент, а винаги в някакъв по-дълъг период, в някаква поредица от моменти.

Re: Correlation and causation

Тогава, ако трябва да спазваме принципа на Мил, трябва да търсим съответствие между отклоненията на стойностите на двата признака не около техните общи средни (каквито разбира се, винаги съществуват и винаги могат да бъдат намерени), а около техните индивидуални средни.
Следователно, за да твърдим, че съществува зависимост между признаците, трябва при преобладаващия брой държави, да съществува съответствие между вариациите на двата признака. Нещо повече, това съответствие трябва да е общо взето едно и също в този преобладаващ брой от държави.