«ßíäåêñ» îòêðûë äëÿ âñåõ áèáëèîòåêó YaFSDP. Îíà çíà÷èòåëüíî óñêîðÿåò îáó÷åíèå áîëüøèõ ÿçûêîâûõ ìîäåëåé — êàê ñîáñòâåííîé ðàçðàáîòêè, òàê è ñòîðîííèõ, ñ îòêðûòûì èñõîäíûì êîäîì. Áèáëèîòåêà äàåò óñêîðåíèå äî 25% — ðåçóëüòàò çàâèñèò îò àðõèòåêòóðû è ïàðàìåòðîâ íåéðîñåòè. Ñ ïîìîùüþ YaFSDP òàêæå ìîæíî ðàñõîäîâàòü äî 20% ìåíüøå ðåñóðñîâ ãðàôè÷åñêèõ ïðîöåññîðîâ (GPU), êîòîðûå òðåáóþòñÿ äëÿ îáó÷åíèÿ. Òåïåðü YaFSDP ìîãóò èñïîëüçîâàòü êîìïàíèè, ðàçðàáîò÷èêè è èññëåäîâàòåëè ïî âñåìó ìèðó. Îá ýòîì CNews ñîîáùèëè ïðåäñòàâèòåëè «ßíäåêñà».
Áèáëèîòåêà «ßíäåêñà» ðàññ÷èòàíà â ïåðâóþ î÷åðåäü íà áîëüøèå ÿçûêîâûå ìîäåëè, õîòÿ îíà ïîäõîäèò è äëÿ äðóãèõ íåéðîñåòåé — íàïðèìåð, òàêèõ, êîòîðûå ãåíåðèðóþò èçîáðàæåíèÿ. YaFSDP ïîçâîëÿåò ñîêðàòèòü ðàñõîäû íà îáîðóäîâàíèå äëÿ îáó÷åíèÿ ìîäåëåé — ýòî îñîáåííî âàæíî äëÿ ñòàðòàïîâ è, ê ïðèìåðó, íàó÷íûõ ïðîåêòîâ.
Îäíà èç ñëîæíîñòåé â îáó÷åíèè áîëüøèõ ÿçûêîâûõ ìîäåëåé — ýòî íåäîñòàòî÷íàÿ çàãðóçêà êàíàëîâ êîììóíèêàöèè ìåæäó ãðàôè÷åñêèìè ïðîöåññîðàìè. YaFSDP ýòî ðåøàåò. Áèáëèîòåêà îïòèìèçèðóåò èñïîëüçîâàíèå ðåñóðñîâ GPU íà âñåõ ýòàïàõ îáó÷åíèÿ: pre-training (ïðåäâàðèòåëüíîå), supervised fine-tuning (ñ ó÷èòåëåì), alignment (âûðàâíèâàíèå ìîäåëè). Áëàãîäàðÿ ýòîìó YaFSDP çàäåéñòâóåò ðîâíî ñòîëüêî ãðàôè÷åñêîé ïàìÿòè, ñêîëüêî íóæíî äëÿ îáó÷åíèÿ, ïðè ýòîì êîììóíèêàöèþ ìåæäó GPU íè÷òî íå çàìåäëÿåò.
«ßíäåê»ñ ðàçðàáîòàë YaFSDP â ïðîöåññå îáó÷åíèÿ ñâîåé ãåíåðàòèâíîé ìîäåëè íîâîãî ïîêîëåíèÿ YandexGPT 3. Êîìïàíèÿ óæå ïðîòåñòèðîâàëà áèáëèîòåêó íà ñòîðîííèõ íåéðîñåòÿõ ñ îòêðûòûì èñõîäíûì êîäîì. Íàïðèìåð, åñëè áû YaFSDP èñïîëüçîâàëàñü ïðèìåíèòåëüíî ê ìîäåëè LLaMA 2, ýòàï ïðåäâàðèòåëüíîãî îáó÷åíèÿ íà 1024 ãðàôè÷åñêèõ ïðîöåññîðàõ ñîêðàòèëñÿ áû ñ 66 äî 53 äíåé.
Èñõîäíûé êîä YaFSDP óæå åñòü íà GitHub.


