Darmowy edytor audio o otwartym kodzie źródłowym pozwala agentom AI przycinać i przestawiać ścieżki, zachowując możliwość cofania zmian.

Audionaut, darmowy, otwartoźródłowy edytor audio do pracy na wielu ścieżkach dla systemów Windows, macOS i Linux, wprowadza nietypowe ograniczenie dotyczące edycji wspomaganej przez AI: gdy agent zmienia projekt otwarty już w aplikacji, wprowadzone zmiany można cofnąć za pomocą standardowego systemu cofania edytora.
Funkcja agentów to najnowsze rozwiązanie w projekcie, zgodnie z wpisem dewelopera z 2 października w ramach Show HN. Sam Audionaut jest rozwijany od kilku lat, więc aplikacja nie jest zupełnie nowym projektem.
Sterowanie agentami jest zapewniane za pośrednictwem Model Context Protocol (MCP). Zgodnie z dokumentacją Audionaut serwer MCP udostępnia operacje edytora z wiersza poleceń jako narzędzia, z których mogą korzystać kompatybilni agenci. Obejmują one importowanie i eksportowanie dźwięku, analizowanie klipów, dzielenie i przenoszenie klipów, zmianę wzmocnienia i płynnych przejść, regulację prędkości klipów, układanie aranżacji oraz rozdzielanie ścieżek składowych.
Bardziej nietypowe jest to, co dzieje się, gdy agent pracuje nad projektem, który jest już otwarty. Audionaut informuje, że polecenie agenta działa na podstawie bieżącego stanu projektu w aplikacji, łącznie z niezapisanymi zmianami, a wynikowa edycja jest następnie dodawana do zwykłej historii cofania. W tym trybie plik projektu nie jest zapisywany automatycznie, więc to użytkownik decyduje, kiedy go zapisać.
Edycje użytkownika mają też pierwszeństwo. Jeśli użytkownik wprowadzi kolejną zmianę, zanim polecenie agenta zostanie wykonane, dokumentacja informuje, że wynik działania agenta zostaje odrzucony, a zamiast nadpisania nowszej edycji użytkownika ponawiana jest próba. Polecenia są odrzucane podczas nagrywania, a eksport — podczas odtwarzania.
Projekt wzbudził też zainteresowanie na Hacker News. Jeden z użytkowników, który napisał, że testował Audionaut przez kilka minut, zasugerował kilka ulepszeń, w tym łatwiejsze importowanie plików, automatyczne przenikania, obwiednie i efekty. Deweloper poinformował, że kilka z tych sugestii trafiło już do listy zadań projektu. Są to anegdotyczne komentarze, a nie dowód na ogólną wydajność Audionaut ani skalę jego popularności.
Agenci mogą również wywoływać funkcję separacji ścieżek w Audionaut. Dokumentacja separacji ścieżek w projekcie podaje, że funkcja korzysta z modelu htdemucs firmy Meta AI Research za pośrednictwem demucs.cpp, aby przekształcić wybrany klip mono lub stereo w cztery ścieżki: Perkusja, Bas, Inne i Wokal.
Zgodnie z dokumentacją model separacji wymaga jednorazowego pobrania pliku o rozmiarze około 80 MB, po czym przetwarzanie odbywa się lokalnie na komputerze użytkownika. Audionaut informuje, że cała separacja jest traktowana jako jedna edycja, co oznacza, że jedna operacja cofania usuwa wszystkie cztery nowo utworzone ścieżki. Obecna implementacja przetwarza klipy o długości do dziesięciu minut i wykonuje separację na procesorze CPU.
Nie dowodzi to, że edycje generowane przez agenta Audionaut ani separacja ścieżek są lepsze niż w innych narzędziach audio, a deweloper zaznacza, że automatycznie uzyskane rezultaty nadal mogą wymagać ręcznej edycji. Wyróżnikiem tej implementacji jest sposób, w jaki operacje agenta są zintegrowane z istniejącym projektem i systemem cofania edycji w edytorze, zamiast być traktowane jako nieodwracalne zmiany wprowadzane z zewnątrz.
Audionaut jest dostępny jako bezpłatne oprogramowanie open source. Oficjalna strona internetowa udostępnia wersje dla systemów Windows, macOS i Linux, a kod źródłowy można znaleźć w repozytorium projektu w serwisie GitHub.













