Demontaż ujawnia, że Huawei Kirin 9050 Pro wykorzystuje w SoC warstwową konstrukcję przypominającą 3D V-Cache, a wyniki są imponujące.

Geekerwan opublikował analizę budowy Huawei Kirin 9050 Pro, układu SoC zastosowanego w Mate 90 Pro Max. Kanał zlecił laboratorium wykonanie przekroju układu i odtworzenie jego wnętrza w 3D, aby pokazać, jak działa pierwszy układ Huawei wykorzystujący technologię LogicFolding.
Dwie matryce spojone ze sobą
Konwencjonalny SoC ma podłoże, warstwy metalu i jedną warstwę logiczną na wierzchu. Kirin 9050 Pro ma natomiast dwie ułożone jedna na drugiej struktury, połączone hybrydowo miedź z miedzią, co łączy ich warstwy metalu. Struktura obliczeniowa jest wykonana w procesie SMIC N+3 (mniej więcej o jeden stopień lepszym niż węzły klasy 6 nm innych odlewni). Druga struktura, mieszcząca pamięć podręczną, interfejsy I/O i układy PLL, jest wykonana w procesie SMIC N+2 (mniej więcej równoważnym TSMC N6). Ani Huawei, ani SMIC nie potwierdziły bezpośrednio zastosowanych węzłów.
Zasilanie i sygnały docierają do obu struktur przez przelotki krzemowe (TSV). Geekerwan szacuje, że około 80 000 takich przelotek łączy układ z podłożem. Przechodzą one przez dolną strukturę, aby dotrzeć do górnej, a ich strefy ochronne zajmują około 8% użytecznej powierzchni dolnej struktury.
Koncepcja przypomina 3D V-Cache firmy AMD, gdzie pamięć podręczna znajduje się na osobnej, połączonej strukturze. Tutaj połączenia hybrydowe są znacznie gęściej rozmieszczone, co powinno skrócić drogę między jednostkami wykonawczymi a pamięcią podręczną i zmniejszyć opóźnienia.
LogicFolding firmy Huawei nie polega po prostu na umieszczeniu całych bloków na jednej albo drugiej strukturze. Każdy główny blok rozciąga się na obie struktury, co widać na zdjęciu struktury wykonanym przez Kurnala. W rdzeniu Prime większość jednostek wykonawczych znajduje się na górnej strukturze, a pamięci podręczne L1 i L2 — na dolnej, bezpośrednio pod jednostkami ładowania i zapisu. To samo dotyczy GPU, ISP, NPU i modemu. Krótsze połączenia powinny zmniejszyć opóźnienia i umożliwić pracę przy niższym napięciu i tej samej częstotliwości taktowania. Pamięć podręczna, interfejsy I/O i układy PLL trafiają na dolną strukturę, ponieważ wydzielają mniej ciepła i są mniej wrażliwe na proces technologiczny. Bloki obliczeniowe trafiają na górną strukturę, gdzie odprowadzanie ciepła jest skuteczniejsze.
Ulepszony NPU
NPU to największe ulepszenie. Łączna powierzchnia obu matryc jest o 150% większa niż w modelu 9030 Pro. Geekerwan zmierzył przepustowość na poziomie 68 TOPS dla INT8 i trzykrotną poprawę etapu prefill w przypadku modelu z 3 mld parametrów.
Telefony z tym układem obsługują lokalnie model typu mixture-of-experts 30B-A2B (30 mld parametrów, z czego jednocześnie aktywne są 2 mld). Umożliwia on porządkowanie zdjęć i sugerowanie ich edycji bez połączenia z internetem, a także zasila asystenta AI Huawei, który do edycji wykorzystuje multimodalny model 6B. Dla porównania Apple korzysta z lokalnego modelu 20B-A4B. Wszystkie telefony Kirin 9050 Pro mają 16 GB RAM-u, więc Huawei może przechowywać większy model w szybkiej pamięci. NPU wciąż ustępuje najnowszym konkurencyjnym układom, dlatego Huawei aktywuje mniejszą część parametrów niż rozwiązanie Apple.
Imponujące wyniki w grach
W testach gier Geekerwan twierdzi, że wydajność Huawei Mate 90 Pro Max w Genshin Impact przewyższa wydajność niektórych telefonów z Snapdragon 8 Elite Gen 5 i tylko nieznacznie ustępuje telefonom z układami Snapdragon 8 Elite Extreme Gen 6 oraz Apple A19 Pro. W Wuthering Waves układ wypada lepiej niż telefony z Dimensity 9500. W Neverness to Everness niemal dorównuje telefonom z Androidem wyposażonym w Dimensity 9500 i Snapdragon 8 Elite, choć urządzenia z Androidem działają w nieco wyższej rozdzielczości.
Wyniki w dużym stopniu zależą jednak od tego, czy gry zostały przeniesione na HarmonyOS. Tytuły uruchamiane za pośrednictwem warstwy translacyjnej, takie jak Arknights: Endfield, są mniej wydajne i osiągają niższą liczbę klatek na sekundę.





