Управление на европроекти управление на европроекти
Apple

Проучване на Apple разкрива недостатъци в моделите на изкуствен интелект, базирани на LLM

Проучване на Apple разкрива недостатъци в моделите на изкуствен интелект, базирани на LLM

Неотдавнашно проучване на Apple изтъкна значителни ограничения в големите езикови модели (LLM), като посочи, че тези модели не разполагат с основни възможности за разсъждение.

Изследването, проведено от учени по изкуствен интелект на Apple, предложи нов критерий – GSM-Symbolic – за измерване на способностите за разсъждаване на ИИ. Този бенчмарк изследва слабостите в математическото разсъждаване чрез добавяне на контекстуална информация към въпроси, които не засягат основни математически понятия.

Недостатъци в разсъжденията при учениците с висше образование

Изследването показва, че дори малки промени във формулировката на запитванията могат да доведат до значително различни отговори, което подкопава надеждността на моделите.

Например математическа задача, включваща киви, в която е добавена допълнителна ирелевантна информация, показва, че LLM като модела на OpenAI и Llama3-8b на Meta могат да дадат неверни отговори.

Този проблем е допълнително илюстриран от задача, наречена „GSM-NoOp“, която включва аритметична задача с думи на ниво горен курс на началното училище. Запитването включва ненужна информация за размера на някои кивита, която не би трябвало да влияе на общия брой на избраните кивита.

-25% ОТСТЪПКА ОТ ХОСТИНГ jump.bg намаление

Въпреки това моделите изваждат по-малките кивита от общия резултат, което показва провал в логическото мислене.

Символен бенчмарк на GSM

За да се справят с тези ограничения, изследователите са разработили GSM-Symbolic – нов инструмент, предназначен да провери границите на LLM в математическото разсъждение. Този бенчмарк създава символни шаблони от тестовия набор GSM8K, което позволява генерирането на множество екземпляри и проектирането на контролируеми експерименти.

Проучването установи, че повечето модели на изкуствен интелект постигат по-ниски резултати на GSM-Symbolic, отколкото на GSM8K, което показва значителен спад в представянето дори когато се променят само числовите стойности във въпроса.

Импликации на изследването

Констатациите от това проучване имат значителни последици за разработването и внедряването на модели с изкуствен интелект.

Изследователите стигат до заключението, че не е възможно да се изградят надеждни агенти върху основа, при която промяната на една или две думи по несвързан начин или добавянето на нерелевантна информация може да доведе до различни отговори.

Тази крехкост в математическото разсъждение подкопава надеждността на ИУМ, особено при задачи, изискващи истинско разбиране и логически изводи.

Отговор от общността на изкуствения интелект

Изследователят от OpenAI Боаз Барак отговори на проучването, като отбеляза, че много от настоящите LLM са чат модели, предназначени за диалог, а не за математически изпити. Барак предполага, че подобряването на подсказките би могло да възстанови резултатите при аритметичните задачи, но признава ограниченията на настоящите модели.

В отговор на тези констатации OpenAI обяви разработването на нов модел на ИИ, наречен „Strawberry“, който се фокусира върху изводите за обработка на сложни математически и програмни задачи.

Заключение

В обобщение, проучването на Apple подчертава острата необходимост от по-стабилни бенчмаркове и по-добре разработени модели на ИИ, които могат да се справят със сложни задачи за разсъждение, без да се провалят при малки промени във входните данни.

Разработването на GSM-Symbolic и други подобни бенчмаркове има за цел да се справи с тези ограничения, проправяйки пътя за по-надеждни и ефективни системи за ИИ в бъдеще.

Back to top button