ИИ знает, что он не знает? Как психология 1970-х может улучшить наш prompt engineering
Habr ·

На днях я наткнулся на статью на VC.ru о том, как инженер Anthropic Тарик Шихипар работает с Claude. В основе довольно простая конструкция: перед большой задачей он раскладывает знания на четыре категории. То, что мы знаем. То, про что понимаем, что не знаем. То, что знаем настолько хорошо, что даже не считаем нужным проговаривать. И, наконец, то, о существовании чего вообще не подозреваем. Последний пункт особенно противный. Сложно задать хороший вопрос о вещи, про которую ты даже не знаешь, что её стоило спросить. Вообще ничего об этой вещи ты ещё не знаешь, в первую очередь - о её существовании. Тут я поймал дежавю, потому что эта конструкция напоминала что-то из старой психологии. Полез разбираться и довольно быстро провалился в кроличью нору из prompt engineering в работы 1970-х о метакогниции, затем в исследования того, способны ли языковые модели оценивать собственное знание, а оттуда обратно в Anthropic, только уже в их работы по introspection и mechanistic interpretability. Короче, исходный совет «сначала разберитесь, чего вы не знаете» оказался только верхушкой гораздо более интересной истории. Если смотреть на исследования Anthropic последних лет, начинает просматриваться одна повторяющаяся тема. Вся исследовательская линия Anthropic последние годы крутится вокруг одной и той же фундаментальной проблемы: как понять границы знания системы и увидеть то, чего мы сами о ней не знаем. Но началось всё, конечно, не с Claude. Просветиться
На днях я наткнулся на статью на VC.ru о том, как инженер Anthropic Тарик Шихипар работает с Claude. В основе довольно простая конструкция: перед большой задачей он раскладывает знания на четыре категории. То, что мы знаем. То, про что понимаем, что не знаем. То, что знаем настолько хорошо, что даже не считаем нужным проговаривать. И, наконец, то, о существовании чего вообще не подозреваем. Последний пункт особенно противный. Сложно задать хороший вопрос о вещи, про которую ты даже не знаешь, что её стоило спросить. Вообще ничего об этой вещи ты ещё не знаешь, в первую очередь - о её существовании. Тут я поймал дежавю, потому что эта конструкция напоминала что-то из старой психологии. Полез разбираться и довольно быстро провалился в кроличью нору из prompt engineering в работы 1970-х о метакогниции, затем в исследования того, способны ли языковые модели оценивать собственное знание, а оттуда обратно в Anthropic, только уже в их работы по introspection и mechanistic interpretability. Короче, исходный совет «сначала разберитесь, чего вы не знаете» оказался только верхушкой гораздо более интересной истории. Если смотреть на исследования Anthropic последних лет, начинает просматриваться одна повторяющаяся тема. Вся исследовательская линия Anthropic последние годы крутится вокруг одной и той же фундаментальной проблемы: как понять границы знания системы и увидеть то, чего мы сами о ней не знаем. Но началось всё, конечно, не с Claude. Просветиться