Dataconomy PL
Subscribe
No Result
View All Result
Dataconomy PL
Subscribe
No Result
View All Result
Dataconomy PL
No Result
View All Result

Bytedance Vapo: Ulepszenie AI, o których wkrótce usłyszysz

byKerem Gülen
11 kwietnia 2025
in Badania
Home Badania
Share on FacebookShare on Twitter
Google Preferred Source

Badacze nasion Bytetedance wdrożyli wartość rozszerzoną bliższą optymalizacją polityki (VAPO), ramy szkolenia uczenia się wzmocnienia zaprojektowane w celu wyostrzenia rozumowania dużych modeli języków na złożonych, długich zadań, osiągając nowe najnowocześniejsze wyniki w odniesieniu AIME24.

Szkolenie LLM dla skomplikowanego rozumowania przy użyciu uczenia się wzmocnienia opartego na wartości, które wcześniej miały do ​​czynienia z znaczącymi przeszkodami. Metody zmagały się z odchyleniem modelu wartości, skutecznie dostosowując się do sekwencji odpowiedzi o bardzo różnej długości i zarządzanie rzadkimi sygnałami nagrody, szczególnie w zadaniach opartych na weryfikatorach, zapewniając tylko binarne informacje zwrotne.

VAPO zajmuje się tymi wyzwaniami poprzez trzy podstawowe innowacje: szczegółowe ramy szkoleń oparte na wartości, dostosowujące się do ogólnej wartości szacunkowej (GAE) dostosowujące parametry oparte na długości odpowiedzi oraz systematyczną integrację technik z wcześniejszych badań.

Ta kombinacja tworzy system, w którym ulepszenia działają synergistycznie. Korzystając z modelu QWEN2.5-32B bez określonych danych SFT, VAPO poprawił wyniki porównawcze od 5 do 60, przewyższając poprzednie najnowocześniejsze metody o 10 punktów.

VAPO opiera się na algorytmie bliższej optymalizacji polityki (PPO), ale zawiera kluczowe modyfikacje w celu zwiększenia rozumowania matematycznego. Analiza treningowa ujawniła, że ​​VAPO wykazuje gładsze krzywe treningowe w porównaniu z metodą DAPO bez wartości, co wskazuje na bardziej stabilną optymalizację.

VAPO wykazało również lepszą skalowanie długości w celu poprawy uogólnienia, szybszego wzrostu wyniku przypisywania ziarnistości sygnałów z modelu wartości i niższej entropii na późniejszych etapach treningu. Podczas gdy zmniejszona entropia może potencjalnie ograniczyć eksplorację, metoda skutecznie to równoważy, poprawiając odtwarzalność i stabilność przy minimalnym wpływie wydajności.

Bytedance-vapo-the-ai-upgrade-youll-hear-about-aon
Zdjęcie: nasiona Bytedance

W odniesieniu AIME24 Deepseek R1 przy użyciu GRPO osiągnął 47 punktów, a Dapo osiągnął 50 punktów. VAPO, korzystając z modelu QWEN-32B, dopasowało wydajność DAPO z zaledwie 60% kroków aktualizacji i ustalił nowy najnowocześniejszy wynik 60,4 w 5 000 kroków. Natomiast waniliowy PPO uzyskał zaledwie 5 punktów z powodu załamania uczenia się modelu wartości.


Ten punkt odniesienia pyta, czy sztuczna inteligencja może myśleć jak inżynier


Badania ablacyjne potwierdziły skuteczność siedmiu różnych modyfikacji w VAPO. Preferowanie wartości zapobiega załamaniu modelu; Oddzielony GAE umożliwia pełną optymalizację długich odpowiedzi; Adaptacyjny GAE równoważy krótką i długą optymalizację reakcji; Clip-Higher zachęca do dokładnej eksploracji; Utrata poziomu tokena zwiększa ważenie dla długich odpowiedzi; Uwzględnianie pozytywnej utraty LM dodało 6 punktów; a próbkowanie grupy przyczyniło się do 5 punktów do końcowego wyniku.

Badacze atrakcja To VAPO, wykorzystując model QWEN2.5-32B, pokazuje, że to podejście oparte na wartości może zdecydowanie przewyższyć metody wolne od wartości, takie jak GRPO i DAPO, ustanawiając nowy poziom wydajności dla złożonych zadań rozumowania i rozwiązywanie podstawowych wyzwań w modelach wartości szkoleniowej dla długich scenariuszy łańcucha.


Polecane wizerunki

Tags: BytedanceVapo

Related Posts

Nowa teoria ciemnej materii proponuje dwa typy cząstek

Nowa teoria ciemnej materii proponuje dwa typy cząstek

14 lipca 2026
Naukowcy z Penn State zbudowali bezbateryjny, słoneczny układ obliczeniowy

Naukowcy z Penn State zbudowali bezbateryjny, słoneczny układ obliczeniowy

14 lipca 2026
Luka w Google Dialogflow CX umożliwiła badaczom tworzenie nieuczciwych agentów

Luka w Google Dialogflow CX umożliwiła badaczom tworzenie nieuczciwych agentów

14 lipca 2026
Badania antropiczne wprowadzają GRAM do izolowania niebezpiecznej wiedzy o sztucznej inteligencji

Badania antropiczne wprowadzają GRAM do izolowania niebezpiecznej wiedzy o sztucznej inteligencji

9 lipca 2026
Globalne dostawy komputerów osobistych spadają o 5%, ponieważ kryzys pamięci spowodowany sztuczną inteligencją uderza w łańcuchy dostaw

Globalne dostawy komputerów osobistych spadają o 5%, ponieważ kryzys pamięci spowodowany sztuczną inteligencją uderza w łańcuchy dostaw

9 lipca 2026
Według Salesforce tylko 6% pracowników biurowych w Singapurze korzysta codziennie ze sztucznej inteligencji

Według Salesforce tylko 6% pracowników biurowych w Singapurze korzysta codziennie ze sztucznej inteligencji

8 lipca 2026

Recent Posts

  • Microsoft testuje nową funkcję analizy komputera Copilot w systemie Windows 11
  • OpenAI wycofuje przeglądarkę Atlas, aby skupić się na nowej superaplikacji ChatGPT
  • Nowa teoria ciemnej materii proponuje dwa typy cząstek
  • Ruch w wyszukiwarce Google wzrósł o 4% pomimo rywali ze sztuczną inteligencją
  • Wyciek Pixela 11 pokazuje odważne kolory magenty i brzoskwini

Recent Comments

Brak komentarzy do wyświetlenia.
Dataconomy PL

COPYRIGHT © DATACONOMY MEDIA GMBH, ALL RIGHTS RESERVED.

  • Sample Page

Follow Us

  • Sample Page
No Result
View All Result
Subscribe

This website uses cookies to improve your experience. You can choose to accept or reject them. Visit our Privacy Policy.