Показаны сообщения с ярлыком Нассим Талеб. Показать все сообщения
Показаны сообщения с ярлыком Нассим Талеб. Показать все сообщения

суббота, 25 августа 2012 г.

Одураченные случайностью — Полезности

Случайные события оцениваться должны на больших промежутках/выборках, а не маленьких

Многие события случайны и их сложно оценивать в реальном времени. Зачастую некоторая характеристика постоянно меняется (цена акции, эффективность работы, частота сбоев оборудования, …) и если её оценивать на малых промежутках времени, то такая оценка работает очень слабо или не работает. Более эффективно в таких случаях оценивать работу на больших промежутках: вместо оценки расходов каждый день оценивать расходы раз в месяц; вместо диагноза за один промах считать количество промахов за месяц/квартал; решили по утрам делать зарядку — оцениваем результат через месяц, а не на следующий день.

Если мы часто обращаемся за информацией (например проверяем курс USD), то получаем много эмоциональных эффектов от плюс-минус. Если обращаемся редко, то от такого эффекта избавляемся и можем грамотно и аккуратно строить выводы.

Оценка не только вероятности, но и уровня полезности

Оцениваться должен как вероятность риска, так и уровень потерь при риске, и уровень выигрыша в риске.

Если с вероятностью 90% мы проиграем, то это не говорит о том, что мы обязательно не должны пробовать. Если мы тратим всего 1$, а с вероятностью 10% получаем 100$, то это означает, что в среднем мы сыграем в +9.1$ (100$*0.1-1*0.9$). Если у нас много таких вот малых шансов, то можем получить более вероятный стабильный результат.

Стабильность стабильна до редкого события

Одно из утверждений: валюты, которые показывают наибольшую историческую стабильность, являются наиболее склонны к крушениям (редким). Например малое государство привязывает валюту к доллару США (узнаете? (; только в книге другие примеры), и в какой-то момент внезапный и всем неожиданный, валюта резко обрушивается.

Основание для статистики — только одно

Если логическое-аксиоматическое основание статистики изменилось, то статистику можно смело выкидывать.

Если мы собираем статистику в одних условиях, то она скорее всего будет неприменима для других условий. Таким образом, чем уже и быстрее выборка, тем статистика эффективнее. Чем быстрее мы её используем и как можно ближе или внутри выборки, тем лучше. Если прошло со времени статистики много времени или много изменений, то её можно смело выкидывать.

Мы не можем предсказать всё

В 80е и 90е годы акции компаний США в среднем увеличили свобю стоимость в 20 раз. Зная этот факт, есть пропаганда, что надо вкладываться именно в акции. Но особенность в том, что люди не видят в ряде случаев альтернативных историй, потому как с таким же успехом можно было вкладываться в Российские Имперские облигации и потом пытаться вернуть деньги от Советского правительства, можно было скупать недвижимость в Аргентине в 30-х и остаться с носом и пр.. Происходит потому, что мы обучены действовать в рамках известной информации, игнорируя то, что есть за её пределами. Реализация с наибольшей производительностью будет самой видимой, так как проигравшие ситуации не обнаруживаются.

Если программист говорит, что проект будет выполнен за X дней, то это вполне вероятно означает самый лучший вариант из всех Вселенных. То есть, если взять миллион альтернативных путей развития, то самый лучший из них будет в X дней. А худшие могут быть меньше в разы. Почему так происходит? Потому что внезапные события не видны, они игнорируются. То есть, если все будет хорошо, ничего не сломается, не надо будет дебажить, допиливать внезапные глюки, приспосабливать под конкретное железо и прочая, то проект вложится в X дней.


четверг, 23 августа 2012 г.

Одураченные случайностью — Оценка случайных факторов

Отсутствие количественной оценки

Если вы участвуете в гонке на велосипедах поперек Сибири, и выигрываете на 1 секунду, то очевидно, что вы не можете хвастаться, что вы быстрее, чем оппонент. Возможно вам что-то помогло, или, быть может, это случайность и ничего больше. Секунды недостаточно для того, чтобы делать вывод вида: велосипедист A лучше велосипедиста B потому, что он питается шпинатом, а B ест морковку по утрам; причина — это то, что A победил B на 1.3 секунды в 3000 километровой гонке.

Если мы видим программу, которая отработала на 1% быстрее или съела на 1% памяти меньше, то это не говорит о том, что она однозначно лучше. Если мы покупаем что-то за 100$, а рядом лежит что-то конкурирующее за 101$, то это вряд ли говорит о том, что такая разница в стоимости значима. В обоих случаях могли сыграть случайные факторы и скорее рекомендуется отбросить оценку подобной значимости и попробовать найти что-то более значимое. Возможно это проблема Буриданова осла и решать её нужно соответствующе.

Анализ причинно-следственной связи

Если известно, что в этом году в больнице A родилось 52% мальчика, а в больнице B 48%, то могли бы вы сказать, что у вас родился мальчик потому, что он рождался в больнице A?

Неужели все будет плохо лишь потому, что кто-то не постучал по дереву или кому-то перебежала дорогу черная кошка?

Мозг пытается найти причины любого хорошего или плохого исхода, цепляясь за все подряд. То есть, если что-то произошло хорошее или плохое, то он пытается в этом контексте уловить существенные детали, и связать следствие с причиной. Это происходит инстинктивно и подсознательно, создавая суеверия, приметы и прочее (я выигрываю в покер потому что у меня красный галстук и счастливая подкова в кармане — примета появилась тогда, когда человек выиграл в покер; в это время он заметил, что он был в красном галстуке и в кармане завалялась подкова).

Такие связи могут привести к ложным выводам, но биологически наша уверенность пусть даже в неработающей гипотезе более выгодна, нежели отсутствие какой-либо гипотезы. Нам эмоционально тяжелее отклонить утверждение, чем принять его.

Небольшой толчок для лавины

Долгое время снег накапливается на вершине горы. И достаточно одного события, чтобы лавина сошла вниз. Аналогично, дом может долго стоять и медленно разрушаться. Но потом один небольшой толчок разрушить все. Есть что-то, что накапливается или имеет потенциал, а в дальнейшем по какому-то сигналу приходит в движение.

Зачастую люди ставят софт не потому, что он такой хороший, а потому, что сосед выбрал себе такой. Поэтому нужно не сколько создать нужный софт, а сколько создать его так, чтобы его начали распространять. И когда все на него подсядут, идти дальше, так как выбить его другим софтом будет трудно.

Аналогичный эффект имеют системы голосования, когда известны предыдущие голоса. Например нужно выбрать лучшую композицию года. Люди делают выбор не сколько по качеству, пересмотрев все или часть, а сколько выбрав из тех, кто набрал больше всего голосов. В ряде случаев достаточно набрать некоторую критическую массу и эта масса уже начнет работать на себя.


среда, 22 августа 2012 г.

Одураченные случайностью — Логика

Вероятностная логика

Люди о произошедших событиях судят как о 100%-тно вероятных. Что могло произойти только так, как произошло, и никак иначе.

Более того. Люди не привыкли и зачастую не умеют рассуждать вероятностно. Например никто не делает выводов что мы на 20% правы, а на 80% нет. Сомневаюсь, что кто-то рассуждает тем образом, что за следующий год он 0.1% что умрет и что 99.9% нет (пример статистики средней температуры по больнице в штатах).

Так уж натренировано наше мышление, что оно принимает зачастую не вероятности, а только бинарные мнения (требование ответа на вопрос только да или нет).

Отсутствие отрицательных тестов

Если мы все время тянем шары, и они все время черные, то мы не можем определить закономерность. То есть, отсутствие события не является основанием для выводов. Только если мы увидим какие-то изменения, то тогда мы можем судить о качестве и свойствах события.

Программно: если тест всегда выдает true, и никогда не выдает false, то это возможно говорит о том, что он просто сломан.

Если мы не наблюдали событие X никогда, то не факт, что отличное событие не наблюдается вовсе.

Если мы делаем заключение, что все лебеди белые (на основании ряда наблюдений), то такое заключение не проходит проверку Поппера. Мы не можем поставить эксперимент и убедиться, что все лебеди действительно белые.

Может происходить так, что если событие всегда одинаковое или чего-то не происходит, то это усиливает уверенность в чем-то. Но от маловероятностного события не защищает. Например если человек перебежал улицу 1000 раз на красный свет и остался жив, то это может вселить уверенность в то, что перебегать можно. Но осознание риска произойдет только тогда, когда что-то произойдет.

Вершина айсберга

Когда мы берем в руки книгу, и читаем на ней отзывы, то мы видим только самые лучшие отзывы. И даже более того — самые лучшие отрывки из контекста среди отзывов. Получить хорошие отзывы легко — нужно сделать запрос на (например) 10 000 отзывов и выбрать из них лучшие отрывки (процесс аналогичен "Таинственное письмо").

Мы не видим тех научных публикаций, которые неуспешны. Мы видим только успешные. Поэтому мы не можем оценить всех обезьян на рассматриваемой области. Если результатов нет, то это потому, что за них никто не брался? Или потому, что много кто брался, но ничего не получил?

Если кто-то начал распространять некоторое лекарство, то часть больных, принимая его, могла улучшить свое состояние засчет случайных факторов, плацебо и т.п.. Соответственно, распространитель берет нескольких таких выздоровевших и говорит, что вот, мое средство их избавило. Но по сути — это вершина айсберга. Мало кто знает, скольким людям это не помогло, скольким оно добавило побочных эффектов. То есть, по сути, любая реклама как мнение человека может быть вершиной айсберга.

Информация, которая говорит, что человек успешен, может не является значимой или уместной. Может быть более важным из какого размера популяции он вышел. Все видят гугл, но мало кто знает, какая битва поисковиков была в то время (сколько поисковых машин было написано). Мы видим олимпийского чемпиона, но мало знаем о том, сколько людей тренировалось и сошло с дистанции.


вторник, 21 августа 2012 г.

Одураченные случайностью — Вероятностные очки

Одна из ключевых мыслей книги — одеть вероятностные очки и видеть особенности происходящего.

Невидимые обезьяны

При оценке обстоятельств часто получается так, что мы не знаем тех факторов, на основе которых ситуация сложилась.

Если взять несколько миллионов обезьян, и попросить их что-нибудь написать, то есть вероятность, что одна из них напишет Гамлета. Но если продолжить рассуждения дальше, то поставите ли вы все свои сбережения на то, что та обезьяна, которая написала Гамлета, потом напишет Одиссею? Если вы знаете о факте миллионов обезьян, то вряд ли сделаете ставку. То есть, если мы понимаем, что это случайность, то мы не будем делать ставку. Но если например мы взяли пять обезьян, и одна из них написала Гамлета, то это уже меняет вопрос во многом.

Идем дальше. Рассмотрим двух людей, каждый из которых заработал 1000000$. Первый прилежно работал дантистом и скопил капитал. Второму же миллиардер предложил сыграть в русскую рулетку (1 из 6 случаев которой заканчивается трагически) и в случае выигрыша тот давал бы ему 1M$. Если не вдаваться в детали, то для внешнего наблюдателя ситуация одинакова (у каждого есть 1M$), но по сути — разная, так как во втором случае только 5 обезьян из 6 получают выигрыш, а 6-ю обезьяну зачастую не видно.

Первая основная мысль в том, что когда люди видят случайные события, то они не считают обезьян. Они видят только само событие и считают его 100%-тно вероятным. Например видят миллионера и говорят, что в жизни ему надо подражать. Но при этом они не знают, сколько подобных попыток осталось бесполезными и сколько людей сошло с дистанции. Люди видят того, кто выиграл в лотерею, но не знают, сколько не выиграло. Кроме того, сам обладатель такой суммы зачастую не знает, за счет чего и каких вероятностей он её заработал.

Невозможность объяснить причин успеха

Никто не воспринимает случайность в собственном успехе. Только в своей неудаче.

Если человек выигрывает, то он редко приходит к мнению, что ему повезло. Что все так потому, что оказался в нужное время в нужном месте, или что так сложились обстоятельства. Чаще всего мы считаем, что положительный результат — это победа за счёт того, что мы такие умные и особенные.

Если человек проигрывает, то он чаще считает, что ему просто не повезло. Тжс если выигрывают другие.

На эту тему мне нравится пример от Сида Мейера (18:20-21:20). В вольной интерпретации:

Есть два отряда Civ, которые друг с другом сражаются. У одного сила 3, у второго 1. Математически игра сделана так, что вероятность выигрыша пропорциональна силе, т.е. у первого 75%, а у второго 25% шансов на победу. Если игрок выигрывает с силой 3, то все нормально. Если проигрывает, то он идет к дизайнеру и говорит:

— Тут что-то не так, у меня сила 3, а у него 1, и он выиграл!

— Ну вот смотрите.. здесь 3, там 1, вероятность считается так …

— Нет, вы не поняли. У него 1, а у меня 3!! 3 — это большое число, а 1 — маленькое! И он выиграл! …

— Ок, сейчас подкрутим, изменим…

Но если игрок с силой 1 выигрывает 3, то он комментирует ситуацию так: "У меня была продуманная тактика, сильная стратегия, а ещё я очень хитро сыграл и потому выиграл!"

Альтернативные Вселенные

Люди часто судят о произошедших событиях как о 100%-тно вероятных. Но если мы попробуем откатить все назад, в то время, когда событие ещё не произошло, то событие не кажется наверняка сбывающимся.

Классический пример: "ну почему я не сделал так!" в контексте произошедшего события. Но на момент решения событие ещё не произошло, оно имеет вероятность совсем не 100%. В этот момент лучше подумать о том, в скольких альтернативных Вселенных, которые могли иметь место в различных случаях, мы проиграли бы в случае такого или другого решения.

Возьмем дворника, который регулярно покупает лотерейные билеты, и дантиста, который стабильно зарабатывает некоторую сумму денег. Допустим, дворник выиграл в лотерею. Но будем ли мы говорить, что нужно жить и поступать как дворник, чтобы быть успешным? Ведь дворник выиграл в лотерею всего в одной из миллиона альтернативных Вселенных, которые могли иметь место при таком поведении. И, в среднем, дантисты в этих всех Вселенных выигрывают дворников.

Можно быть безумным в своих стремлениях и работать 20 часов в сутки. Но это необходимое, но не достаточное условие успеха. Потому как можно стать после такой работы знаменитым и значимым как Ньютон, а можно быть забытым историей как паровая машина Ползунова. Нельзя сделать что-то наверняка, но засчет усилий можно увеличить вероятность успеха, например как Эдисон перебрал 1000 вариантов лампочек.

Ганнибал, Гитлер, Александр Македонский и Юлий Цезарь были безумны в своих стремлениях. Первые двое не достигли своих целей, а вторые достигли. Но сложно о них думать как о вероятных, так как в некоторых альтернативных Вселенных первые двое могли выиграть, а вторые во множестве других проиграли.


воскресенье, 19 августа 2012 г.

Одураченные случайностью — Жизненные совпадения

Упрощенные некоторые интересные и можно сказать игровые ситуации, взятые из книги «Одураченные случайностью».

Таинственное письмо

Вы получаете анонимное письмо, 2-ого января, сообщающее вам, что рынок (курс валюты, стоимость акции, …) будет повышаться в течение месяца. Это оказывается правдой, но вы игнорируете его. В дальнейшем вы получаете другое письмо, 1-ого февраля, сообщающее вам, что рынок понизится. Опять это оказывается правдой. Далее получаете следующее письмо, 1-ого марта — опять та же история. К июлю вы заинтригованы предвидением анонима и вас он просит вложить капитал в специальный фонд. Вы вкладываете туда все ваши сбережения. Двумя месяцами позже, ваши деньги пропали. Вы проливаете слезы на плече вашего соседа и он сообщает вам, что он помнит, что он получил два таких таинственных письма. Но почтовые послания остановились на втором письме. Он вспоминает, что первое предсказание был правильным, а второе — нет.

Что случилось? Трюк в следующем. Мошенник-оператор берет 10,000 имен из телефонной книги. Он отправляет письмо о повышении рынка одной половине выборки, и второй — о понижении. В следующем месяце остаются имена людей, кому он отправил письма с правильным предсказанием, то есть 5,000 человек. И далее история повторяется, когда он делает то же самое для оставшихся 2,500 имен, пока список не сузится до 150 человек к июлю. Из них 75 будут жертвами. Инвестиция в тысячу долларов в почтовые марки превращается в несколько миллионов.

Если вас ищут, то в этом что-то не так

Если мы смотрим трансляцию матча, и по его результатам появляется куча фондов/людей, которые говорили, что они предсказали правильно, то об этом стоит задуматься. Так как если бы они действительно умели предсказывать, то они вряд ли бы себя рекламировали. Поэтому если к нам стучаться в дверь и говорят, что они такие успешные, то вряд ли они относятся напрямую к успешным. Вероятность мошенничества ближе к 100%. Но если мы возьмем всех представителей выборки, и выберем из них, то вероятность найти успешного будет выше и близка к средней по больнице.

Парадокс дня рождения и то, как тесен Мир

Известный парадокс, согласно которому многим кажется парадоксально, что если мы возьмем группу из ~23 человек, то вероятность дня рождения у хотя бы одной из пар людей в группе будет более 50%. Интуитивно это сложно, но при рассмотрении совсем не сложно — так как совпадение дней рождения это пара, а пар дней рождений в группе из N человек N*N шт.

Аналогичным эффектом обладают совпадения в жизни вида «Как тесен Мир!». Если мы видим какое-либо редкое событие, то оно кажется нам редким, но на самом деле в мире очень больше количество редких событий, и когда мы видим одно из них — то это естественно. Если у нас номер чека 127683, то он или часть его может совпасть с номером телефона, с номером машины, с номером квартиры, другим чеком, количеством $ на счету, расстоянием от Земли до Солнца, и со всеми другими известными нам числами. Если мы внезапно встречаем человека на улице, то следует понимать, что внезапно мы можем встретить любого человека, которого знаем, при чем каждого из них можно встретить в любой из дней.

Аналогично — если кто-то видит совпадения в «коде книги», то это имеет такой же эффект — во всей книге как на узоре ковра, можно найти любые комбинации, которые будут сравниваться со всем нашим опытом, N*N раз.

Проверка гипотезы

Регулярно можно наблюдать такую ситуацию. Есть большая выборка данных, и люди начинают в ней искать зависимости. Мозг также это пытается делать, даже в случае, если зависимостей нет. Например, если происходит какое-либо удачное событие, или неудачное, то мозг пытается найти причины этого события. Установить причинно-следственную связь с цветом галстука, или с каким-либо жестом, или с черной кошкой, или с рукопожатием над порогом и многое другое, рождая таким образом суеверия.

Этот процесс естественно-биологичен, и только сознательно мы можем его контролировать, что полезно в большом количестве случаев, особенно тогда, когда причины такого события неизвестны и все произошло фактически случайно. Один из способов борьбы — принимать сначала утверждение, что что-то произошло случайно, а потом уже искать действительно имеющие место и основание причинно-следственные связи.

На эту тему хорошо подходит бритва Хэнлона. Очень многое более случайно, чем мы думаем.

Ещё один, более сильный метод борьбы, из Machine Learning. Берем выборку, устанавливаем закономерность. Далее эту выборку необходимо проверить — на других данных выборки. Для этого берем новые элементы и проверяем. Если гипотеза подтверждается, то она более верна, чем не верна. При таком подходе зависимости вида «ураган в Месопотамии из-за взмаха крыльев бабочки в Австралии» отсекаются моментально.

Раковые кластеры

Рассмотрим квадрат, в который случайно бросили 16 дротиков (каждый из них попал в случайное место). Если разделить квадрат на 16 одинаковых по площади частей, то окажется, что среди них есть такие, где нет ни одного дротика, и такие где есть 2, 3 и даже более дротиков. И такая картина может казаться не совсем случайной.

Результатом наблюдения за такой картиной может быть появление «Бермудского треугольника». То есть там, где больше всего дротиков (утонуло кораблей) и находится злополучное место. Хотя на самом деле это результат случайного совпадения.


четверг, 16 августа 2012 г.

Нассим Талеб — Одураченные случайностью

Книга о роли вероятностей, случайностей и удачи в нашей жизни. О том, какие ошибки делают люди при оценке рисков, что они не видят в своем планировании, как в целом не приспособлен человеческий мозг к решению вероятностных задач.

Книга давно ждала своего часа на стеке, и ожидания оказались не напрасны. Часть информации известна и понятна, но даже она стала более интуитивной и привязанной к опыту.

В одном посте разместить все слишком накладно и долго, поэтому здесь избранное, для колорита книги. Специально как очевидные, так и с изюмом — чтобы можно было поразмышлять. В каждом из пунктов ошибка в рассуждениях и она поставлена как задача. Если интересны ответы — спрашивайте или читайте первоисточник (;

Операция

Наша операция имеет смертность 1%. Поскольку мы успешно прооперировали 99 пациентов, то сейчас ваша операция имеет 100%-тную смертность.

По статистике вы уже должны были умереть

Ожидаемая средняя продолжительность жизни 73 года. Если вам 68 лет, то спланируйте оставшиеся 5 лет соответственно, позаботтесь о них! А если вам 80 лет, то качественно спланируйте оставшиеся минус 7 лет.

Медицинский тест

Тест на заболевание дает 5% ложных положительных результатов. Болезнь зарагивает 1/1000 населения. Люди проверяются наугад, независимо от того, подозреваются ли они в наличии болезни. Тест положителен. Какова вероятность того, что пациент поражен болезнью?

Большинство докторов (4 из 5) отвечат, что 95%. Но ответ — условная вероятность, и тест показывает около 2%!

Смертельный диагноз

Известно, что половина пациентов с таким диагнозом проживет 8 месяцев. Как думаете, сколько в среднем проживет каждый из них? (ответ 8 месяцев — неправильный).