Rona

Strix Halo 로컬 AI 추론 서버 만들기

고급502026-06-03

Strix Halo Linux 장비에서 입고 관리, 클레임 수정, 검역 문서를 로컬 AI 서버로 처리할 수 있도록 Vulkan 기반 llama.cpp 서버의 설정과 실행 자동화를 구성합니다. 최종 결과물은 빌드 자동화 코드, 모델별 서버 설정 JSON, dry-run 검증이 가능한 실행 스크립트, 그리고 Notion에 붙여넣기 좋은 운영 요청 템플릿 묶음입니다.

이 코칭은 터미널에서 진행됩니다

이런 걸 배워요

  • Strix Halo 장비에서 Vulkan 백엔드 사용 가능 여부를 점검할 수 있습니다.
  • Qwen 계열 GGUF 모델별 실행 설정을 업무 목적에 맞게 분리할 수 있습니다.
  • 128k 컨텍스트, MTP 드래프팅, cache type 설정이 반영된 llama-server 명령을 재현 가능하게 관리할 수 있습니다.
  • 입고 관리·클레임 수정·검역 문서를 로컬 AI 서버에 넣기 좋은 요청 템플릿으로 정리할 수 있습니다.

어떻게 진행해요

1. Strix Halo 실행 환경 점검
2. 운영 업무 프로필 작성
3. Qwen 모델 실행표 구성
4. Vulkan 빌드 자동화 코드 작성
5. 128k 서버 설정 구성
6. 실행 자동화 코드 완성
7. Notion용 운영 요청 템플릿 작성
8. 구성 검증과 인수인계 문서화

AI 튜터가 각 단계를 하나씩 안내해줄 거예요