Ферма жұмысы

Майнинг алаңында ақауды ерте байқау: pool дабылы мен метрика баптауы

Бір машина түнде тоқтап қалса, оны таңертең емес, 10 минут ішінде білу керек. Бұл материалда 10–100 ASIC ұстайтын алаңға арналған ең қажетті бақылау жиыны берілген: pool жағындағы тегін дабыл, машинадағы метрика нүктесі және шынымен керек төрт ескерту.

Майнинг алаңында ақауды ерте байқау: pool дабылы мен метрика баптауы

Шағын алаңда ең қымбат ақау — ешкім байқамаған ақау. Бір машина түн ортасында тоқтаса және оны таңертең сағат онда байқасаңыз, он сағаттық өндіріс жоғалады. Сондықтан 10–100 ASIC ұстайтын алаңға қымбат платформаның қажеті жоқ — жоғалтуды азайтатын ең аз жиын екі деңгейден тұрады: pool жағындағы дабыл және машина жағындағы метрика.

1-деңгей. Pool жағындағы бақылау: ақысыз және бірінші кезекте

Ең алдымен pool аккаунтындағы бақылауды қосыңыз. Бұл ештеңе орнатуды қажет етпейді және машина желіден үзілген жағдайда да жұмыс істейді — себебі өлшеуді pool жүргізеді, машина емес.

Braiins Pool құжаттамасы бойынша бақылау Mining → Settings → Reporting бөлімінде қосылады (email немесе мобильді қосымша арқылы), содан кейін әр воркер профилінде жеке іске қосылады. Pool барлық воркердің тиімді хэшрейтін әр 5 минут сайын суретке түсіріп, оны Alert limit мәнімен салыстырады. Шекті қолмен қоюға немесе жүйеге өткен өнімділік негізінде есептетуге болады.

Braiins Pool ресми құжаттамасындағы Device monitoring states кестесі: OK, Low, Offline және Disable күйлерінің сипаттамасы

Воркер төрт күйдің бірінде болады, және бұл айырмашылық практикада маңызды:

  • OK — хэшрейт шектен жоғары немесе оған тең.
  • Low — машина әлі share жіберіп тұр, бірақ хэшрейт тиістіден төмен. Бұл әдетте салқындату, жиілік төмендеуі немесе бір хэшбордтың істен шығуы.
  • Offline — воркерден хэшрейт мүлде көрінбейді. Қорек, желі немесе машинаның толық тоқтауы.
  • Disable — бақылау сол воркер үшін өшірілген, яғни ондағы ақауды ешкім көрмейді.

Практикалық кеңес: воркер атауын машинаның физикалық орнымен байланыстырып қойыңыз (мысалы, қатар мен позиция нөмірі). Әйтпесе хабарлама келгенде қай машинаны іздеу керегін білмейсіз.

Low күйі мен Offline күйін бір нәрсе деп қарамаңыз. Offline — бірден барып қарайтын жағдай, ал Low көбіне температураға байланысты және алдымен қашықтан тексеріледі; ол тексерістің реті хэшрейт құлағандағы диагностика реті материалында қадаммен жазылған.

2-деңгей. Машинадағы метрика нүктесі

Pool тек нәтижені — хэшрейтті көреді. Ал себепті (температура, желдеткіш айналымы, қуат, reject үлесі) машинаның өзінен оқу керек.

Braiins OS жұмыс істейтін машиналар метрикаларды әр құрылғының өзінде [machine-ip]:8081/metrics мекенжайында жариялайды; зауыттық firmware-дегі машиналар үшін деректі metrics exporter деген бөлек қызмет жинайды. Формат Prometheus үшін дайын, яғни оны браузерден қарапайым мәтін ретінде де ашып көруге болады.

Braiins Farm Monitor құжаттамасының Metrics and Labels беті: метрика мен label құрылымының мысалы және 8081/metrics мекенжайы

Құжаттамада көрсетілген, шағын алаңға шынымен керек метрикалар:

  • temperature — чип температурасы (хэшборд пен орын бойынша белгіленеді).
  • fan_rpm_feedback — әр желдеткіштің нақты айналымы.
  • average_hashrate_last_30_min_ghs — 30 минуттық орташа хэшрейт, лездік саннан әлдеқайда сенімді.
  • hashboard_nominal_hashrate_ghs — номинал мән, салыстыру үшін керек.
  • stratum_rejected_submits_counter — қабылданбаған share саны.
  • miner_power және miner_power_target_w — нақты және мақсатты қуат.
  • up — құрылғының жауап беруі.

Осы жетеуін жинасаңыз, «неге құлады» деген сұрақтың басым бөлігіне жауап бересіз.

Шынымен қажет төрт дабыл

Онға жуық машинада ондаған ескерту қоюдың қажеті жоқ — көп дабыл тез шуға айналады да, адам оларды оқуды қояды. Ең аз пайдалы жиын:

  1. Воркер Offline — pool жағында, 10–15 минуттық кідіріспен. Кідіріс керек, себебі қысқа желі үзілісі өздігінен қалпына келеді.
  2. Жалпы хэшрейт номиналдан 10%-дан артық төмен, 30 минут бойы — бір машинаның емес, алаңның деңгейінде. Бұл бір хэшбордтың өлгенін немесе бірнеше машинаның жиілік төмендеткенін көрсетеді.
  3. Чип температурасы firmware-дегі Hot шегіне жақындады — нақты сан модель мен firmware-ге байланысты, сондықтан шекті өз машинаңыздың интерфейсінен оқып алыңыз, болжап қоймаңыз.
  4. Желдеткіш айналымы нөл немесе күрт өзгерді — бұл әдетте температура дабылынан бұрын келеді, яғни сізге әрекет етуге уақыт береді.

Бесінші орынға қоятын, бірақ пайдалы ескерту — reject үлесінің өсуі: ол көбіне желі немесе баптау мәселесін көрсетеді және табысқа тікелей әсер етеді.

Prometheus пен Grafana керек пе?

Құжаттамада метрикалар дәл Prometheus форматында берілгендіктен, Prometheus + Grafana жинағы — табиғи жалғасы. Braiins Academy өз мысалдарында, айталық, барлық машинаның ең жоғары температурасының орташасын avg(max by (instance) (temperature)) сұрауымен, ал жалпы қуатты sum(miner_power_target_w{type="current"}) сұрауымен алуды көрсетеді.

Бірақ шешімді шынайы бағалаңыз. Он машина үшін pool дабылы мен аптасына бір рет интерфейсті қарап шығу жеткілікті. Жүз машинада графиксіз жұмыс істеу қиын: сіз бір машинаны емес, тренд пен топты бақылайсыз. Шекараны машина санымен емес, мына сұрақпен қойған дұрыс: бір машина бір тәулік бойы байқалмай тұрып қалса, қанша жоғалтасыз? Егер бұл сан сервер мен баптауға кететін уақыттан асып кетсе, мониторингті құрған жөн. Тоқтап қалған сағаттың нақты бағасын есептеу әдісі тоқтап қалу мен жөндеу шығынын есептеу материалында берілген.

Шекті қалай таңдау керек

Ең жиі кездесетін қате — шекті тым тар қою. Хэшрейт табиғи түрде ауытқиды, ал жазда температура да заңды түрде өседі, сондықтан:

  • Шекті лездік емес, орташа мәнге байлаңыз (30 минут немесе 24 сағат).
  • Әр дабылға кідіріс қосыңыз: шарт бірнеше өлшеу бойы сақталса ғана хабарлама жіберілсін.
  • Шекті маусым бойынша бір рет қайта қараңыз — жазғы және қысқы қалыпты температура әртүрлі. Салқындату шығынының маусымдық өзгерісі жазғы салқындату шығыны материалында есептелген.
  • Түнгі хабарламалардың қайсысы шынымен оятуға тұрарлық екенін алдын ала шешіп алыңыз: Offline және температура — иә, reject үлесінің аздап өсуі — жоқ.

Бір күнде істеуге болатын ең аз жиын

  1. Pool аккаунтында email немесе қосымша хабарламасын қосыңыз.
  2. Әр воркерге бақылауды қосып, шекті қойыңыз.
  3. Воркер аттарын физикалық орынмен сәйкестендіріңіз.
  4. Бір машинаның :8081/metrics бетін ашып, сандардың шынымен келетінін тексеріңіз.
  5. Жоғарыдағы төрт дабылды жазып қойыңыз және алдымен қолмен тексеріп көріңіз.
  6. Бір машинаны әдейі өшіріп, хабарламаның шынымен келетінін және қанша уақытта келетінін өлшеңіз.

Соңғы қадамды өткізіп жібермеңіз: тексерілмеген дабыл жүйесі — жоқ дабыл жүйесі.

Дереккөздер және ескерту

Pool жағындағы бақылау логикасы, 5 минуттық снапшот және воркер күйлері Braiins Pool ресми құжаттамасының Monitoring бетінен; метрика атаулары, 8081/metrics мекенжайы және PromQL мысалдары Braiins Farm Monitor құжаттамасының Metrics and Labels және PromQL Examples беттерінен алынды (2026-10-05 тексерілді). Басқа pool мен firmware-де атаулар, шектер және қолжетімді өрістер өзгеше болуы мүмкін, сондықтан өз жүйеңіздегі мәндерді интерфейстен растаңыз. Мақалада ұсынылған дабыл шектері — жалпы бастапқы нүкте; нақты сандар алаңның температурасы, модель және firmware нұсқасы бойынша реттеледі.