Пост-теоретическая наука: пузырь надувается, но всё одно лопнет
Вот очередной текст про очередную смерть науки, новую "компьютерную эпистемологию без теорий", опубликованную в The Guardian, "Are we witnessing the dawn of post-theory science?", 9 января 2022, https://www.theguardian.com/technology/2022/jan/09/are-we-witnessing-the-dawn-of-post-theory-science. Пост абсолютно типовой, но media is the message. Всё-таки это The Guardian, и это уже "попса". Основная тамошняя мысль: всё стало настолько сложным по части объяснений, что человеческий мозг не в состоянии решать проблемы. Поэтому берём нейронную сетку помощнее (например, AlphaFold) и она решает сверхсложную проблему (например, как сворачивается белок), просто за счёт обучения на данных. Всё, теория построена, но это ж ни разу не теория в привычном нам виде, не объяснение, это просто "гигантская формула, дающее правильное предсказание".
Я тут обращусь к моему тексту, уточняющему отделение исследований и объяснений/знаний, "Объяснения и исследования: Перл и Дойч, и ещё Марлетто", https://ailev.livejournal.com/1605383.html. И я даже не буду критиковать эту "пост-теоретическую науку" по понятным линиям:
-- большинство методов машинного обучения используют таки "выдвижение гипотез" и их проверку. Другое дело, что это всё внутри одного алгоритма. Но тот же Дойч указывал, что идея появляется внутри одного мозга исследователя, и наружу выходит только тогда, когда она проходит первичную проверку. Тут примерно то же самое, только "мозг" ну очень мощный.
-- мы говорим тут только об "объяснении по Перлу", однократном получении предсказателя (хотя и без графа причинности)
-- как только мы получили обученную нейронную сетку, мы можем изучать её устройство, "что же она такое выучила" и это облегчит выдвижение догадок даже в этих "сверхсложных областях"
-- это ж линия с GPT-3, то есть всё верно про супер-пупер-дупер интуицию: когда всё ОК, то более чем ОК, а когда ошибка -- то самая наиглупейшая. То есть подобные "предсказатели" могут давать глупейшие ошибки, легко проверяемые логикой.
-- это одиночные предсказатели для одной задачи, шаг вправо-влево будет побег, а на всё множество проблем в мире предсказателей не напасёшься
-- ... и так далее.
Нет, мой ответ будет по линии, которую я наметил в самом конце своего поста про Перла, Дойча и Марлетто, ибо эта линия заканчивалась 21 годом, работой Марлетто про науку нельзя и льзя, объединяющей линию Перла "одомашнивания причинности" (одно исследование как подтверждение или опровержение какого-то графа причинности, который берётся от эксперта) и линию Дойча (наука/исследования/бесконечное развитие как постоянное выдвижение идей о новых типах графов причинности, в которых используются другие типы объектов внимания, в какой-то мере это же можно и рассматривать как ход на representation learning, приводящий к получению новых репрезентаций по мере накопления исходных данных, выдающих те самые "наиглупейшие ошибки"). Я сказал в этом посте, что дальше можно ожидать развития по линии эволюции объяснений, разбирательство с этим в планах на 2022 год, https://ailev.livejournal.com/1601601.html
В работе Ванчурина et al https://arxiv.org/abs/2110.14602 про многоуровневую эволюцию как обучение делается замечание про то, что в эволюции как обучении с необходимостью возникает ситуация, когда нужно иметь хорошую память, чтобы накапливались результаты. И появляется "цифра", допускающая не аналоговое, а цифровое (точное) копирование. И тем самым мы переходим к символьному знанию, а не "сумме весовых коэффициентов нейронной сети". Эта же идея есть и у Дойча, когда он говорит о необходимости универсальных цифровых вычислений и приводит в пример RNA и DNA, идеи то "носятся в воздухе", и одновременно можно ожидать выхода работ множества учёных. Часть этих работ я и привёл по ссылке в https://ailev.livejournal.com/1601601.html. Чтобы получить эволюцию объяснений/знаний на этих вот гигантских "вычислителях закономерностей" всё равно придётся получать классические объяснения в виде компактных графов причинности. Эти объяснения будут "цифровыми" и очень компактными (то есть таки они будут "теориями" в весьма близком к сегодняшнему смыслах, хотя и можно ожидать, что они будут не любыми идеями, а именно объяснениями), иначе их трудно будет накапливать, копировать в другие вычисления по получению новых знаний (в аналоговых операциях ошибка быстро нарастает при их повторении, а ещё случайные изменения довольно быстро по историческим масштабам приводят к деградации системы -- росту энтропии).
Я не буду тут забегать вперёд, с этими всеми работами "физической эволюции" и "информационной термодинамики" ещё нужно разбираться, но уже понятно, что развитие эпистемологии лежит на развитии идей уровня исследований/науки как добычи всей совокупности плотно перевязанных друг с другом объяснений/знаний в целом. Ведущая идея тут -- бесконечного развития, то есть идея эволюции, и она включает в себя ещё и выход на "цифровые формы", то есть выход на какие-то легко и точно воспроизводимые символьные/цифровые репликаторы (знания -- это мемы, которые заставляют себя воспроизводить), а не просто на работу "универсальных аналоговых предсказывающих аппроксиматоров". Нейросети же универсальные аппроксиматоры! Соблазн вот так взять их использовать для одной задачи велик! И это хорошо, для одной проблемы на одном системном уровне рассмотрения это вполне можно делать. Проблема, когда проблемы разные и из разных предметных областей. Помним, что уравнения Максвелла объясняют огромное количество электромагнитных явлений, вот я говорю о таком уровне объяснений, таком уровне борьбы со сложностью описаний. AlphaFold и прочим подобным "предсказателям-решателям" до такого как до Луны. Одному человеку тоже. Но если допустить обмен объяснениями между самыми разными вычислителями, которые имеют доступ к самым разным ситуациям, то всё на этом коллективном (и даже глобальном) системном уровне исследований в целом/науки выглядит не так уж печально.
Наличие каких-то "необъяснимых предсказателей" не выглядит для меня каким-то главным трендом SoTA исследований/науки, тем более что хватает специальных работ, указывающих на недостатки такого "аналогового" подхода, а хоть и работы того же Перла о необходимости контрфактических объяснений, а не просто "предсказаний" (и дальше можно обсуждать, аналоговые ли графы причинности брать, или как-то их символьно выражать). Как будто без "сверхсложных нейросетей для сверхсложных областей" до этого не было "предсказательных эвристик"!
Есть вот понятие экономического пузыря, который в конечном итоге лопается (напомню, например, об интернет-пузыре, тогда тоже говорили о пост-экономике, в которой стоимость компаний определяется не их прибыльностью, а просто числом клиентов). Тут же мы имеем дело с эпистемологическим пузырём. Ничего страшного, он скоро лопнет.
Но я при этом ничего не говорю о том, что объяснения будут в той форме "текстовых объяснений с вкраплениями формул", в какой мы их привыкли видеть сейчас. Нет, те же причинные графы -- это уже не привычная форма "текстовых объяснений на естественном языке", которую представляет большинство из нас в момент, когда звучит слово "объяснение". Дальше читайте работы Перла, там на тему этих "новых объяснений" много чего сказано.
UPDATE: обсуждение в чате блога с https://t.me/ailev_blog_discussion/13070, комменты в фейсбуке -- https://www.facebook.com/ailevenchuk/posts/10222311303225517
Я тут обращусь к моему тексту, уточняющему отделение исследований и объяснений/знаний, "Объяснения и исследования: Перл и Дойч, и ещё Марлетто", https://ailev.livejournal.com/1605383.html. И я даже не буду критиковать эту "пост-теоретическую науку" по понятным линиям:
-- большинство методов машинного обучения используют таки "выдвижение гипотез" и их проверку. Другое дело, что это всё внутри одного алгоритма. Но тот же Дойч указывал, что идея появляется внутри одного мозга исследователя, и наружу выходит только тогда, когда она проходит первичную проверку. Тут примерно то же самое, только "мозг" ну очень мощный.
-- мы говорим тут только об "объяснении по Перлу", однократном получении предсказателя (хотя и без графа причинности)
-- как только мы получили обученную нейронную сетку, мы можем изучать её устройство, "что же она такое выучила" и это облегчит выдвижение догадок даже в этих "сверхсложных областях"
-- это ж линия с GPT-3, то есть всё верно про супер-пупер-дупер интуицию: когда всё ОК, то более чем ОК, а когда ошибка -- то самая наиглупейшая. То есть подобные "предсказатели" могут давать глупейшие ошибки, легко проверяемые логикой.
-- это одиночные предсказатели для одной задачи, шаг вправо-влево будет побег, а на всё множество проблем в мире предсказателей не напасёшься
-- ... и так далее.
Нет, мой ответ будет по линии, которую я наметил в самом конце своего поста про Перла, Дойча и Марлетто, ибо эта линия заканчивалась 21 годом, работой Марлетто про науку нельзя и льзя, объединяющей линию Перла "одомашнивания причинности" (одно исследование как подтверждение или опровержение какого-то графа причинности, который берётся от эксперта) и линию Дойча (наука/исследования/бесконечное развитие как постоянное выдвижение идей о новых типах графов причинности, в которых используются другие типы объектов внимания, в какой-то мере это же можно и рассматривать как ход на representation learning, приводящий к получению новых репрезентаций по мере накопления исходных данных, выдающих те самые "наиглупейшие ошибки"). Я сказал в этом посте, что дальше можно ожидать развития по линии эволюции объяснений, разбирательство с этим в планах на 2022 год, https://ailev.livejournal.com/1601601.html
В работе Ванчурина et al https://arxiv.org/abs/2110.14602 про многоуровневую эволюцию как обучение делается замечание про то, что в эволюции как обучении с необходимостью возникает ситуация, когда нужно иметь хорошую память, чтобы накапливались результаты. И появляется "цифра", допускающая не аналоговое, а цифровое (точное) копирование. И тем самым мы переходим к символьному знанию, а не "сумме весовых коэффициентов нейронной сети". Эта же идея есть и у Дойча, когда он говорит о необходимости универсальных цифровых вычислений и приводит в пример RNA и DNA, идеи то "носятся в воздухе", и одновременно можно ожидать выхода работ множества учёных. Часть этих работ я и привёл по ссылке в https://ailev.livejournal.com/1601601.html. Чтобы получить эволюцию объяснений/знаний на этих вот гигантских "вычислителях закономерностей" всё равно придётся получать классические объяснения в виде компактных графов причинности. Эти объяснения будут "цифровыми" и очень компактными (то есть таки они будут "теориями" в весьма близком к сегодняшнему смыслах, хотя и можно ожидать, что они будут не любыми идеями, а именно объяснениями), иначе их трудно будет накапливать, копировать в другие вычисления по получению новых знаний (в аналоговых операциях ошибка быстро нарастает при их повторении, а ещё случайные изменения довольно быстро по историческим масштабам приводят к деградации системы -- росту энтропии).
Я не буду тут забегать вперёд, с этими всеми работами "физической эволюции" и "информационной термодинамики" ещё нужно разбираться, но уже понятно, что развитие эпистемологии лежит на развитии идей уровня исследований/науки как добычи всей совокупности плотно перевязанных друг с другом объяснений/знаний в целом. Ведущая идея тут -- бесконечного развития, то есть идея эволюции, и она включает в себя ещё и выход на "цифровые формы", то есть выход на какие-то легко и точно воспроизводимые символьные/цифровые репликаторы (знания -- это мемы, которые заставляют себя воспроизводить), а не просто на работу "универсальных аналоговых предсказывающих аппроксиматоров". Нейросети же универсальные аппроксиматоры! Соблазн вот так взять их использовать для одной задачи велик! И это хорошо, для одной проблемы на одном системном уровне рассмотрения это вполне можно делать. Проблема, когда проблемы разные и из разных предметных областей. Помним, что уравнения Максвелла объясняют огромное количество электромагнитных явлений, вот я говорю о таком уровне объяснений, таком уровне борьбы со сложностью описаний. AlphaFold и прочим подобным "предсказателям-решателям" до такого как до Луны. Одному человеку тоже. Но если допустить обмен объяснениями между самыми разными вычислителями, которые имеют доступ к самым разным ситуациям, то всё на этом коллективном (и даже глобальном) системном уровне исследований в целом/науки выглядит не так уж печально.
Наличие каких-то "необъяснимых предсказателей" не выглядит для меня каким-то главным трендом SoTA исследований/науки, тем более что хватает специальных работ, указывающих на недостатки такого "аналогового" подхода, а хоть и работы того же Перла о необходимости контрфактических объяснений, а не просто "предсказаний" (и дальше можно обсуждать, аналоговые ли графы причинности брать, или как-то их символьно выражать). Как будто без "сверхсложных нейросетей для сверхсложных областей" до этого не было "предсказательных эвристик"!
Есть вот понятие экономического пузыря, который в конечном итоге лопается (напомню, например, об интернет-пузыре, тогда тоже говорили о пост-экономике, в которой стоимость компаний определяется не их прибыльностью, а просто числом клиентов). Тут же мы имеем дело с эпистемологическим пузырём. Ничего страшного, он скоро лопнет.
Но я при этом ничего не говорю о том, что объяснения будут в той форме "текстовых объяснений с вкраплениями формул", в какой мы их привыкли видеть сейчас. Нет, те же причинные графы -- это уже не привычная форма "текстовых объяснений на естественном языке", которую представляет большинство из нас в момент, когда звучит слово "объяснение". Дальше читайте работы Перла, там на тему этих "новых объяснений" много чего сказано.
UPDATE: обсуждение в чате блога с https://t.me/ailev_blog_discussion/13070, комменты в фейсбуке -- https://www.facebook.com/ailevenchuk/posts/10222311303225517