Niekonwencjonalna sztuczna inteligencja ujawniła eksperymentalny model generowania obrazu, który zastępuje konwencjonalne obliczenia wymagające dużej liczby obliczeń symulowaną siecią fizycznych oscylatorów. Startup twierdzi, że podstawowe podejście może ostatecznie zużyć nawet 1000 razy mniej energii niż obecne systemy sztucznej inteligencji.
Model o nazwie Un-0 jest pierwszym dowodem słuszności koncepcji firmy. Firma Unconventional AI została założona przez badaczy, w tym profesora nadzwyczajnego MIT Michaela Carbina, adiunkta na Uniwersytecie Stanforda Sarę Achour, byłego inżyniera Google MeeLana Lee i byłego szefa AI Databricks Naveena Rao. Zespół opublikował szczegóły techniczne 25 czerwca i udostępnił model w GitHub.
Większość komputerów wykonuje obliczenia, szybko przełączając miliardy tranzystorów między stanami włączenia i wyłączenia. Generatory obrazu oparte na modelach dyfuzji rozpoczynają od szumu wizualnego i wielokrotnie obliczają, co należy usunąć, aby uzyskać żądany obraz, zwykle obejmując od 20 do 50 etapów udoskonalania.
Zamiast tego Un-0 reprezentuje informację poprzez oscylatory, systemy fizyczne wytwarzające powtarzające się fale. Połączone oscylatory w naturalny sposób wpływają na siebie nawzajem, dopóki ich rytmy nie zaczną się wyrównywać – jest to proces opisany w modelu Kuramoto.
Aby wygenerować obraz, system przypisuje różne wzorce fazowe oscylatora do kategorii takich jak buty czy pociągi. Mniejsza grupa skonfigurowana z pożądanym wzorcem działa jak podpowiedź i stopniowo przyciąga szerszą sieć losowo rozmieszczonych oscylatorów w kierunku tego samego układu.
Następnie system rejestruje końcowe fazy oscylatorów w postaci siatki numerycznej. Oddzielny dekoder konwertuje tę siatkę na wartości pikseli w celu wytworzenia obrazu.
Niekonwencjonalna sztuczna inteligencja twierdzi, że fizyczny oscylator mógłby zużywać znacznie mniej energii elektrycznej, ponieważ prąd przepływałby w sposób ciągły w zamkniętych pętlach, a nie był wymuszany przez biliony operacji przełączania tranzystorów. Istniejący model Un-0 nie zapewnia jeszcze takich oszczędności, ponieważ symuluje oscylatory na konwencjonalnym sprzęcie. Docelowo firma planuje opracować dedykowane chipy oparte na oscylatorach.
Naukowcy przetestowali Un-0, korzystając ze zbiorów danych obrazów CIFAR-10 i ImageNet 64×64. Na CIFAR-10 wynik odległości początkowej Frécheta poprawił się z 11,01 przy 1024 oscylatorach do 8,76 przy 4096 oscylatorach. Niższe wyniki wskazują, że wygenerowane obrazy bardziej przypominają dane referencyjne.
W ImageNet 64×64 wynik poprawił się z 8,41 przy 6656 oscylatorach do 6,74 przy 16384 oscylatorach. Naukowcy stwierdzili, że wyniki były porównywalne z wynikami wczesnych generatorów obrazów, takich jak BigGAN firmy Google i iDDPM firmy OpenAI, chociaż przestrzegli, że liczby należy traktować jako punkty odniesienia, a nie bezpośrednio równoważne pomiary.
Zespół przyznał, że obecne generatory obrazów w dalszym ciągu zapewniają lepszą ogólną jakość przy bardziej efektywnym wykorzystaniu ich parametrów. Niekonwencjonalna sztuczna inteligencja udostępniła wagi modeli, kod szkoleniowy i skrypty ablacji, aby inni badacze mogli przetestować to podejście i przeprowadzić własne symulacje.





