Fork me on GitHub

Wikimedia IRC logs browser - #wikimedia-operations

Filter:
Start date
End date

Displaying 1496 items:

2026-04-17 00:03:09 <wikibugs> 'SRE-swift-storage, ''MediaWiki-File-management: Stuck-hidden file - https://phabricator.wikimedia.org/T423065#11832147 (''Pppery) Still happening: https://en.wikipedia.org/wiki/User_talk:Pppery#File%3AHambonesMeditations.jpg'
2026-04-17 00:03:11 <logmsgbot> !log jasmine@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host wikikube-ctrl2006.mgmt.codfw.wmnet with chassis set policy GRACEFUL_RESTART
2026-04-17 00:03:54 <logmsgbot> !log jasmine@cumin1003 START - Cookbook sre.hosts.provision for host wikikube-ctrl2006.mgmt.codfw.wmnet with chassis set policy GRACEFUL_RESTART
2026-04-17 00:10:34 <logmsgbot> !log jasmine@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host wikikube-ctrl2006.mgmt.codfw.wmnet with chassis set policy GRACEFUL_RESTART
2026-04-17 00:19:08 <wikibugs> ('CR) ''Dzahn: [C:''+1] "ah yea, I wanted to do the --name thing anyways" [puppet] - ''https://gerrit.wikimedia.org/r/1272961 (https://phabricator.wikimedia.org/T406384) (owner: ''Dduvall)'
2026-04-17 00:19:20 <wikibugs> ('CR) ''Dzahn: [C:''+2] zuul: Name service containers and remove them when stopped [puppet] - ''https://gerrit.wikimedia.org/r/1272961 (https://phabricator.wikimedia.org/T406384) (owner: ''Dduvall)'
2026-04-17 00:21:57 <jinxer-wm> FIRING: ProbeDown: Service text:80 has failed probes (http_text_ip6) #page - https://wikitech.wikimedia.org/wiki/Runbook#text:80 - https://grafana.wikimedia.org/d/O0nHhdhnz/network-probes-overview?var-job=probes/service&var-module=All - https://alerts.wikimedia.org/?q=alertname%3DProbeDown
2026-04-17 00:22:36 <jasmine_> !incidents
2026-04-17 00:22:36 <sirenbot> 7846 (UNACKED) ProbeDown sre (2001:df2:e500:ed1a::1 ip6 text:80 probes/service http_text_ip6 eqsin)
2026-04-17 00:22:36 <sirenbot> 7845 (RESOLVED) TransitPeeringTransportOutSaturation network sre (cr1-eqiad:9804 Transit: NTT (234630) {#3475} xe-3/1/6 gnmi eqiad)
2026-04-17 00:22:37 <sirenbot> 7844 (RESOLVED) TransitPeeringTransportOutSaturation network sre (cr1-eqiad:9804 Transit: Lumen (442550281) {#3867} xe-3/3/2 gnmi eqiad)
2026-04-17 00:22:37 <sirenbot> 7843 (RESOLVED) TransitPeeringTransportOutSaturation network sre (cr1-codfw:9804 Transport: cr4-ulsfo:xe-0/1/1 (Lumen, 442550294) {#12252_12295-1} xe-1/1/1:0 gnmi codfw)
2026-04-17 00:22:48 <jasmine_> !ack 7846
2026-04-17 00:22:48 <sirenbot> 7846 (ACKED) ProbeDown sre (2001:df2:e500:ed1a::1 ip6 text:80 probes/service http_text_ip6 eqsin)
2026-04-17 00:24:17 <sukhe> port 80?
2026-04-17 00:24:20 <sukhe> that's interesting
2026-04-17 00:26:57 <jinxer-wm> RESOLVED: ProbeDown: Service text:80 has failed probes (http_text_ip6) #page - https://wikitech.wikimedia.org/wiki/Runbook#text:80 - https://grafana.wikimedia.org/d/O0nHhdhnz/network-probes-overview?var-job=probes/service&var-module=All - https://alerts.wikimedia.org/?q=alertname%3DProbeDown
2026-04-17 00:26:58 <wikibugs> ('PS2) ''Dzahn: zuul: Provide tenant configuration [puppet] - ''https://gerrit.wikimedia.org/r/1272970 (https://phabricator.wikimedia.org/T406384) (owner: ''Dduvall)'
2026-04-17 00:27:27 <wikibugs> ('CR) ''Dzahn: "it wanted a license for the config file:) added one" [puppet] - ''https://gerrit.wikimedia.org/r/1272970 (https://phabricator.wikimedia.org/T406384) (owner: ''Dduvall)'
2026-04-17 00:32:19 <wikibugs> 'SRE-swift-storage, ''MediaWiki-File-management: Stuck-hidden file - https://phabricator.wikimedia.org/T423065#11832210 (''Ladsgroup) Can't say for sure but maybe that's because of a missing update in the new file schema? See line 192 on the new side https://gerrit.wikimedia.org/r/c/mediawiki/core/+/1273030/1...'
2026-04-17 00:33:27 <jinxer-wm> FIRING: [4x] SystemdUnitFailed: wmf_auto_restart_prometheus-blazegraph-exporter-wdqs-blazegraph.service on wdqs1012:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 00:34:05 <wikibugs> ('CR) ''Dzahn: [C:''+1] "smart-reconfigure is smart :)" [puppet] - ''https://gerrit.wikimedia.org/r/1272970 (https://phabricator.wikimedia.org/T406384) (owner: ''Dduvall)'
2026-04-17 00:36:42 <wikibugs> ('CR) ''Dzahn: [V:''+1 C:''+2] "https://puppet-compiler.wmflabs.org/output/1272970/8435/zuul1001.eqiad.wmnet/index.html"; [puppet] - ''https://gerrit.wikimedia.org/r/1272970 (https://phabricator.wikimedia.org/T406384) (owner: ''Dduvall)'
2026-04-17 00:41:40 <jinxer-wm> FIRING: SystemdUnitFailed: send_tile_invalidations.service on maps2011:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 00:44:57 <jinxer-wm> FIRING: CertAlmostExpired: Certificate for service ssw1-e1-codfw.mgmt.codfw.wmnet:32767 is about to expire - https://wikitech.wikimedia.org/wiki/TLS/Runbook#ssw1-e1-codfw.mgmt.codfw.wmnet:32767 - TODO - https://alerts.wikimedia.org/?q=alertname%3DCertAlmostExpired
2026-04-17 00:47:13 <wikibugs> ('CR) ''Dzahn: [V:''+1 C:''+2] "it had an issue on the very first puppet run but on second run it looked alright." [puppet] - ''https://gerrit.wikimedia.org/r/1272970 (https://phabricator.wikimedia.org/T406384) (owner: ''Dduvall)'
2026-04-17 00:47:24 <wikibugs> ('CR) ''Dzahn: [V:''+1 C:''+2] "please do not worry about "ERROR zuul.GerritConnection.ssh: IsADirectoryError: [Errno 21] Is a directory: '/var/ssh/zuul'" I will fix th" [puppet] - ''https://gerrit.wikimedia.org/r/1272970 (https://phabricator.wikimedia.org/T406384) (owner: ''Dduvall)'
2026-04-17 00:48:07 <jinxer-wm> FIRING: ProbeDown: Service aqs1010-a:9042 has failed probes (tcp_cassandra_a_cql_ip4) - https://wikitech.wikimedia.org/wiki/TLS/Runbook#aqs1010-a:9042 - https://grafana.wikimedia.org/d/O0nHhdhnz/network-probes-overview?var-job=probes/custom&var-module=All - https://alerts.wikimedia.org/?q=alertname%3DProbeDown
2026-04-17 00:51:32 <wikibugs> ('CR) ''Dzahn: [C:''+2] "restarted zuul-nodepool on zuul1001 and they all have the names now:" [puppet] - ''https://gerrit.wikimedia.org/r/1272961 (https://phabricator.wikimedia.org/T406384) (owner: ''Dduvall)'
2026-04-17 00:53:07 <jinxer-wm> FIRING: [2x] ProbeDown: Service aqs1010-a:7000 has failed probes (tcp_cassandra_a_ssl_ip4) - https://grafana.wikimedia.org/d/O0nHhdhnz/network-probes-overview?var-job=probes/custom&var-module=All - https://alerts.wikimedia.org/?q=alertname%3DProbeDown
2026-04-17 00:54:57 <jinxer-wm> FIRING: [2x] CertAlmostExpired: Certificate for service lsw1-e1-codfw.mgmt.codfw.wmnet:32767 is about to expire - TODO - https://alerts.wikimedia.org/?q=alertname%3DCertAlmostExpired
2026-04-17 00:57:08 <wikibugs> 'ops-codfw, ''SRE, ''Data-Persistence, ''DC-Ops: Q4:rack/setup/install 4 new db hosts in codfw - https://phabricator.wikimedia.org/T418911#11832236 (''Jhancock.wm) a:''Jhancock.wm'
2026-04-17 00:57:56 <wikibugs> 'ops-codfw, ''SRE, ''Data-Persistence, ''DC-Ops: Q3:rack/setup/install pc202[1-4] - https://phabricator.wikimedia.org/T418907#11832239 (''Jhancock.wm) a:''Jhancock.wm'
2026-04-17 01:03:52 <icinga-wm> PROBLEM - OSPF status on cr2-eqdfw is CRITICAL: OSPFv2: 7/7 UP : OSPFv3: 6/7 UP https://wikitech.wikimedia.org/wiki/Network_monitoring%23OSPF_status
2026-04-17 01:04:52 <icinga-wm> RECOVERY - OSPF status on cr2-eqdfw is OK: OSPFv2: 7/7 UP : OSPFv3: 7/7 UP https://wikitech.wikimedia.org/wiki/Network_monitoring%23OSPF_status
2026-04-17 01:09:57 <wikibugs> ('PS1) ''TrainBranchBot: Branch commit for wmf/next [core] (wmf/next) - ''https://gerrit.wikimedia.org/r/1273066'
2026-04-17 01:09:57 <wikibugs> ('CR) ''TrainBranchBot: [C:''+2] Branch commit for wmf/next [core] (wmf/next) - ''https://gerrit.wikimedia.org/r/1273066 (owner: ''TrainBranchBot)'
2026-04-17 01:15:14 <icinga-wm> PROBLEM - OSPF status on cr2-esams is CRITICAL: OSPFv2: 3/3 UP : OSPFv3: 2/3 UP https://wikitech.wikimedia.org/wiki/Network_monitoring%23OSPF_status
2026-04-17 01:16:14 <icinga-wm> RECOVERY - OSPF status on cr2-esams is OK: OSPFv2: 3/3 UP : OSPFv3: 3/3 UP https://wikitech.wikimedia.org/wiki/Network_monitoring%23OSPF_status
2026-04-17 01:21:22 <wikibugs> ('Merged) ''jenkins-bot: Branch commit for wmf/next [core] (wmf/next) - ''https://gerrit.wikimedia.org/r/1273066 (owner: ''TrainBranchBot)'
2026-04-17 01:44:57 <jinxer-wm> FIRING: [3x] CertAlmostExpired: Certificate for service lsw1-e1-codfw.mgmt.codfw.wmnet:32767 is about to expire - TODO - https://alerts.wikimedia.org/?q=alertname%3DCertAlmostExpired
2026-04-17 01:45:35 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1261 (T419635)', diff saved to https://phabricator.wikimedia.org/P91004 and previous config saved to /var/cache/conftool/dbconfig/20260417-014534-fceratto.json
2026-04-17 01:45:39 <stashbot> T419635: Drop il_to column from imagelinks table in wmf production - https://phabricator.wikimedia.org/T419635
2026-04-17 01:55:43 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1261', diff saved to https://phabricator.wikimedia.org/P91005 and previous config saved to /var/cache/conftool/dbconfig/20260417-015542-fceratto.json
2026-04-17 01:59:09 <wikibugs> 'SRE, ''Traffic: Investigate port 80 page in text@esams for Ipv6 - https://phabricator.wikimedia.org/T423667 (''jasmine_) ''NEW'
2026-04-17 02:01:16 <logmsgbot> !log mwpresync@deploy1003 Started scap build-images: Publishing wmf/next image
2026-04-17 02:03:36 <wikibugs> 'SRE: Investigate port 80 page in text@esams for Ipv6 - https://phabricator.wikimedia.org/T423667#11832332 (''jasmine_)'
2026-04-17 02:05:51 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1261', diff saved to https://phabricator.wikimedia.org/P91006 and previous config saved to /var/cache/conftool/dbconfig/20260417-020550-fceratto.json
2026-04-17 02:07:42 <logmsgbot> !log mwpresync@deploy1003 Finished scap build-images: Publishing wmf/next image (duration: 06m 25s)
2026-04-17 02:09:17 <jinxer-wm> FIRING: [2x] JobUnavailable: Reduced availability for job sidekiq in ops@codfw - https://wikitech.wikimedia.org/wiki/Prometheus#Prometheus_job_unavailable - https://grafana.wikimedia.org/d/NEJu05xZz/prometheus-targets - https://alerts.wikimedia.org/?q=alertname%3DJobUnavailable
2026-04-17 02:15:59 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1261 (T419635)', diff saved to https://phabricator.wikimedia.org/P91007 and previous config saved to /var/cache/conftool/dbconfig/20260417-021558-fceratto.json
2026-04-17 02:16:03 <stashbot> T419635: Drop il_to column from imagelinks table in wmf production - https://phabricator.wikimedia.org/T419635
2026-04-17 02:16:16 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 12:00:00 on db1262.eqiad.wmnet with reason: Maintenance
2026-04-17 02:16:25 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db1262 (T419635)', diff saved to https://phabricator.wikimedia.org/P91008 and previous config saved to /var/cache/conftool/dbconfig/20260417-021624-fceratto.json
2026-04-17 02:34:17 <jinxer-wm> RESOLVED: [2x] JobUnavailable: Reduced availability for job sidekiq in ops@codfw - https://wikitech.wikimedia.org/wiki/Prometheus#Prometheus_job_unavailable - https://grafana.wikimedia.org/d/NEJu05xZz/prometheus-targets - https://alerts.wikimedia.org/?q=alertname%3DJobUnavailable
2026-04-17 03:25:44 <jinxer-wm> FIRING: KubernetesDeploymentUnavailableReplicas: ...
2026-04-17 03:25:44 <jinxer-wm> Deployment linkrecommendation-internal in linkrecommendation at eqiad has persistently unavailable replicas - https://wikitech.wikimedia.org/wiki/Kubernetes/Troubleshooting#Troubleshooting_a_deployment - https://grafana.wikimedia.org/d/a260da06-259a-4ee4-9540-5cab01a246c8/kubernetes-deployment-details?var-site=eqiad&var-cluster=k8s&var-namespace=linkrecommendation&var-deployment=linkrecommendation-internal - ...
2026-04-17 03:25:44 <jinxer-wm> https://alerts.wikimedia.org/?q=alertname%3DKubernetesDeploymentUnavailableReplicas
2026-04-17 04:04:03 <jinxer-wm> FIRING: MediaWikiEditFailures: Elevated MediaWiki edit failures (session_loss) for cluster - https://wikitech.wikimedia.org/wiki/Application_servers/Runbook - https://grafana.wikimedia.org/d/000000208/edit-count?orgId=1&viewPanel=13 - https://alerts.wikimedia.org/?q=alertname%3DMediaWikiEditFailures
2026-04-17 04:14:55 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1262 (T419635)', diff saved to https://phabricator.wikimedia.org/P91009 and previous config saved to /var/cache/conftool/dbconfig/20260417-041454-fceratto.json
2026-04-17 04:14:59 <stashbot> T419635: Drop il_to column from imagelinks table in wmf production - https://phabricator.wikimedia.org/T419635
2026-04-17 04:25:03 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1262', diff saved to https://phabricator.wikimedia.org/P91010 and previous config saved to /var/cache/conftool/dbconfig/20260417-042502-fceratto.json
2026-04-17 04:33:42 <jinxer-wm> FIRING: [3x] SystemdUnitFailed: wmf_auto_restart_prometheus-blazegraph-exporter-wdqs-blazegraph.service on wdqs1012:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 04:35:10 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1262', diff saved to https://phabricator.wikimedia.org/P91011 and previous config saved to /var/cache/conftool/dbconfig/20260417-043510-fceratto.json
2026-04-17 04:41:40 <jinxer-wm> FIRING: SystemdUnitFailed: send_tile_invalidations.service on maps2011:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 04:45:19 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1262 (T419635)', diff saved to https://phabricator.wikimedia.org/P91012 and previous config saved to /var/cache/conftool/dbconfig/20260417-044518-fceratto.json
2026-04-17 04:45:23 <stashbot> T419635: Drop il_to column from imagelinks table in wmf production - https://phabricator.wikimedia.org/T419635
2026-04-17 04:45:36 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 12:00:00 on db1263.eqiad.wmnet with reason: Maintenance
2026-04-17 04:45:44 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db1263 (T419635)', diff saved to https://phabricator.wikimedia.org/P91013 and previous config saved to /var/cache/conftool/dbconfig/20260417-044543-fceratto.json
2026-04-17 04:49:03 <jinxer-wm> RESOLVED: MediaWikiEditFailures: Elevated MediaWiki edit failures (session_loss) for cluster - https://wikitech.wikimedia.org/wiki/Application_servers/Runbook - https://grafana.wikimedia.org/d/000000208/edit-count?orgId=1&viewPanel=13 - https://alerts.wikimedia.org/?q=alertname%3DMediaWikiEditFailures
2026-04-17 04:49:07 <wikibugs> 'ops-eqiad, ''SRE, ''DBA, ''DC-Ops: Degraded RAID on pc1011 - https://phabricator.wikimedia.org/T423630#11832436 (''Marostegui) p:''Triage''Medium Any used disk that we can use for this host? Thanks!'
2026-04-17 04:53:07 <jinxer-wm> FIRING: [2x] ProbeDown: Service aqs1010-a:7000 has failed probes (tcp_cassandra_a_ssl_ip4) - https://grafana.wikimedia.org/d/O0nHhdhnz/network-probes-overview?var-job=probes/custom&var-module=All - https://alerts.wikimedia.org/?q=alertname%3DProbeDown
2026-04-17 05:08:27 <jinxer-wm> FIRING: [3x] SystemdUnitFailed: wmf_auto_restart_prometheus-blazegraph-exporter-wdqs-blazegraph.service on wdqs1012:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 05:12:19 <wikibugs> ('PS1) ''Marostegui: db2158: Disable notifications [puppet] - ''https://gerrit.wikimedia.org/r/1273316'
2026-04-17 05:12:59 <wikibugs> ('CR) ''Marostegui: [C:''+2] db2158: Disable notifications [puppet] - ''https://gerrit.wikimedia.org/r/1273316 (owner: ''Marostegui)'
2026-04-17 05:13:18 <logmsgbot> !log marostegui@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 5:00:00 on db2158.codfw.wmnet with reason: Reimage to Trixie
2026-04-17 05:13:24 <logmsgbot> !log marostegui@cumin1003 START - Cookbook sre.mysql.depool depool db2158: Reimage to Trixie
2026-04-17 05:13:42 <logmsgbot> !log marostegui@cumin1003 END (PASS) - Cookbook sre.mysql.depool (exit_code=0) depool db2158: Reimage to Trixie
2026-04-17 05:16:25 <jinxer-wm> FIRING: [2x] SystemdUnitFailed: send_tile_invalidations.service on maps1011:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 05:16:37 <logmsgbot> !log marostegui@cumin1003 START - Cookbook sre.hosts.reimage for host db2158.codfw.wmnet with OS trixie
2026-04-17 05:33:57 <logmsgbot> !log marostegui@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on db2158.codfw.wmnet with reason: host reimage
2026-04-17 05:37:36 <wikibugs> ('PS1) ''Marostegui: Revert "db2158: Disable notifications" [puppet] - ''https://gerrit.wikimedia.org/r/1273343'
2026-04-17 05:39:14 <logmsgbot> !log marostegui@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on db2158.codfw.wmnet with reason: host reimage
2026-04-17 05:45:12 <jinxer-wm> FIRING: [3x] CertAlmostExpired: Certificate for service lsw1-e1-codfw.mgmt.codfw.wmnet:32767 is about to expire - TODO - https://alerts.wikimedia.org/?q=alertname%3DCertAlmostExpired
2026-04-17 05:50:00 <wikibugs> ('CR) ''Marostegui: [C:''+2] Revert "db2158: Disable notifications" [puppet] - ''https://gerrit.wikimedia.org/r/1273343 (owner: ''Marostegui)'
2026-04-17 05:56:00 <wikibugs> 'SRE, ''Infrastructure-Foundations: Integrate Trixie 13.4 point update - https://phabricator.wikimedia.org/T420240#11832482 (''MoritzMuehlenhoff)'
2026-04-17 05:58:18 <wikibugs> 'SRE, ''Infrastructure-Foundations, ''Release-Engineering-Team (Radar): Sunsetting mirrors.wikimedia.org - https://phabricator.wikimedia.org/T416707#11832487 (''LSobanski) @bd808 In addition to the good point raised by @A_smart_kitten above the general intent here is to reduce complexity. Leaving a dependen...'
2026-04-17 06:00:05 <jouncebot> Deploy window MediaWiki infrastructure (UTC early) (https://wikitech.wikimedia.org/wiki/Deployments#deploycal-item-20260417T0600)
2026-04-17 06:00:51 <logmsgbot> !log marostegui@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host db2158.codfw.wmnet with OS trixie
2026-04-17 06:03:22 <wikibugs> ('PS3) ''Muehlenhoff: profile::zookeeper::firewall: Also allow passing a list of hosts [puppet] - ''https://gerrit.wikimedia.org/r/1272766'
2026-04-17 06:03:40 <wikibugs> ('PS4) ''Muehlenhoff: profile::zookeeper::firewall: Also allow passing a list of hosts [puppet] - ''https://gerrit.wikimedia.org/r/1272766'
2026-04-17 06:04:20 <logmsgbot> !log marostegui@cumin1003 START - Cookbook sre.mysql.pool pool db2158: repool after maintenance
2026-04-17 06:05:55 <wikibugs> ('PS1) ''Marostegui: db1201: Disable notifications [puppet] - ''https://gerrit.wikimedia.org/r/1273388'
2026-04-17 06:06:05 <wikibugs> ('CR) ''Muehlenhoff: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1272766 (owner: ''Muehlenhoff)'
2026-04-17 06:06:40 <wikibugs> ('CR) ''Marostegui: [C:''+2] db1201: Disable notifications [puppet] - ''https://gerrit.wikimedia.org/r/1273388 (owner: ''Marostegui)'
2026-04-17 06:06:53 <logmsgbot> !log marostegui@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 5:00:00 on db1201.eqiad.wmnet with reason: Reimage to Trixie
2026-04-17 06:06:58 <logmsgbot> !log marostegui@cumin1003 START - Cookbook sre.mysql.depool depool db1201: Reimage to Trixie
2026-04-17 06:07:26 <logmsgbot> !log marostegui@cumin1003 END (PASS) - Cookbook sre.mysql.depool (exit_code=0) depool db1201: Reimage to Trixie
2026-04-17 06:08:21 <logmsgbot> !log marostegui@cumin1003 START - Cookbook sre.hosts.reimage for host db1201.eqiad.wmnet with OS trixie
2026-04-17 06:12:45 <wikibugs> ('PS5) ''Muehlenhoff: profile::zookeeper::firewall: Also allow passing a list of hosts [puppet] - ''https://gerrit.wikimedia.org/r/1272766'
2026-04-17 06:14:15 <jinxer-wm> FIRING: PHPFPMTooBusy: Not enough idle PHP-FPM workers for Mediawiki mw-web releases routed via main at eqiad: 20.04% idle - https://bit.ly/wmf-fpmsat - https://grafana.wikimedia.org/d/U7JT--knk/mw-on-k8s?orgId=1&viewPanel=84&var-dc=eqiad%20prometheus/k8s&var-service=mediawiki&var-namespace=mw-web&var-container_name=All&var-release=main - https://alerts.wikimedia.org/?q=alertname%3DPHPFPMTooBusy
2026-04-17 06:16:24 <wikibugs> 'SRE-swift-storage, ''Ceph, ''Data-Persistence, ''DBA: Data persistance: Re-IP eqiad private baremetal hosts to new per-rack vlans/subnets - https://phabricator.wikimedia.org/T421719#11832500 (''Marostegui)'
2026-04-17 06:16:57 <wikibugs> ('CR) ''Muehlenhoff: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1272766 (owner: ''Muehlenhoff)'
2026-04-17 06:17:02 <wikibugs> 'SRE-swift-storage, ''Ceph, ''Data-Persistence, ''DBA: Data persistance: Re-IP eqiad private baremetal hosts to new per-rack vlans/subnets - https://phabricator.wikimedia.org/T421719#11832504 (''Marostegui)'
2026-04-17 06:22:01 <logmsgbot> !log marostegui@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on db1201.eqiad.wmnet with reason: host reimage
2026-04-17 06:24:15 <jinxer-wm> RESOLVED: PHPFPMTooBusy: Not enough idle PHP-FPM workers for Mediawiki mw-web releases routed via main at eqiad: 20.66% idle - https://bit.ly/wmf-fpmsat - https://grafana.wikimedia.org/d/U7JT--knk/mw-on-k8s?orgId=1&viewPanel=84&var-dc=eqiad%20prometheus/k8s&var-service=mediawiki&var-namespace=mw-web&var-container_name=All&var-release=main - https://alerts.wikimedia.org/?q=alertname%3DPHPFPMTooBusy
2026-04-17 06:24:47 <logmsgbot> !log marostegui@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on db1201.eqiad.wmnet with reason: host reimage
2026-04-17 06:25:06 <wikibugs> 'SRE, ''Maps, ''Traffic: Allow Wikimedia Maps usage on <domain> - https://phabricator.wikimedia.org/T423672 (''Abijithkumar2025) ''NEW Closing this task as invalid due to missing information.'
2026-04-17 06:26:01 <wikibugs> 'SRE, ''Maps, ''Traffic: Allow Wikimedia Maps usage on <domain> - https://phabricator.wikimedia.org/T423672#11832518 (''Abijithkumar2025) ''Invalid''Open'
2026-04-17 06:26:53 <wikibugs> ('PS1) ''Marostegui: Revert "db1201: Disable notifications" [puppet] - ''https://gerrit.wikimedia.org/r/1273408'
2026-04-17 06:27:32 <wikibugs> ('CR) ''Marostegui: [C:''+2] Revert "db1201: Disable notifications" [puppet] - ''https://gerrit.wikimedia.org/r/1273408 (owner: ''Marostegui)'
2026-04-17 06:29:19 <wikibugs> ('PS1) ''Muehlenhoff: Remove bast1003 from list of bastions [puppet] - ''https://gerrit.wikimedia.org/r/1273413'
2026-04-17 06:40:07 <wikibugs> 'SRE, ''Maps, ''Traffic: Allow Wikimedia Maps usage on <domain> - https://phabricator.wikimedia.org/T423672#11832538 (''Aklapper) ''Open''Invalid @Abijithkumar2025: Again: Please do not create empty tasks but fill out all fields.'
2026-04-17 06:40:23 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1263 (T419635)', diff saved to https://phabricator.wikimedia.org/P91019 and previous config saved to /var/cache/conftool/dbconfig/20260417-064023-fceratto.json
2026-04-17 06:40:28 <stashbot> T419635: Drop il_to column from imagelinks table in wmf production - https://phabricator.wikimedia.org/T419635
2026-04-17 06:46:47 <logmsgbot> !log marostegui@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host db1201.eqiad.wmnet with OS trixie
2026-04-17 06:48:28 <logmsgbot> !log marostegui@cumin1003 START - Cookbook sre.mysql.pool pool db1201: after reimage to trixie
2026-04-17 06:49:46 <logmsgbot> !log marostegui@cumin1003 END (PASS) - Cookbook sre.mysql.pool (exit_code=0) pool db2158: repool after maintenance
2026-04-17 06:50:32 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1263', diff saved to https://phabricator.wikimedia.org/P91022 and previous config saved to /var/cache/conftool/dbconfig/20260417-065031-fceratto.json
2026-04-17 06:52:01 <wikibugs> ('PS1) ''Muehlenhoff: Switch Cloud VPS to deb.debian.org [puppet] - ''https://gerrit.wikimedia.org/r/1273441 (https://phabricator.wikimedia.org/T416707)'
2026-04-17 06:52:17 <wikibugs> ('PS2) ''Muehlenhoff: Switch Cloud VPS to deb.debian.org [puppet] - ''https://gerrit.wikimedia.org/r/1273441 (https://phabricator.wikimedia.org/T416707)'
2026-04-17 06:56:50 <wikibugs> ('PS1) ''Jelto: gerrit: migrate data gerrit1003 to /srv/gerrit [puppet] - ''https://gerrit.wikimedia.org/r/1273449 (https://phabricator.wikimedia.org/T333143)'
2026-04-17 06:58:32 <wikibugs> ('PS1) ''Muehlenhoff: Switch the base images to deb.debian.org [puppet] - ''https://gerrit.wikimedia.org/r/1273453 (https://phabricator.wikimedia.org/T423622)'
2026-04-17 07:00:02 <wikibugs> ('CR) ''Jelto: [V:''+1] "PCC SUCCESS (CORE_DIFF 1 NOOP 2): https://integration.wikimedia.org/ci/job/operations-puppet-catalog-compiler/label=puppet7-compiler-node/"; [puppet] - ''https://gerrit.wikimedia.org/r/1273449 (https://phabricator.wikimedia.org/T333143) (owner: ''Jelto)'
2026-04-17 07:00:05 <jouncebot> Deploy window No deploys all day! See Deployments/Emergencies if things are broken. (https://wikitech.wikimedia.org/wiki/Deployments#deploycal-item-20260417T0700)
2026-04-17 07:00:40 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1263', diff saved to https://phabricator.wikimedia.org/P91023 and previous config saved to /var/cache/conftool/dbconfig/20260417-070039-fceratto.json
2026-04-17 07:04:33 <wikibugs> ('CR) ''Arnaudb: [C:''+1] "lgtm!" [puppet] - ''https://gerrit.wikimedia.org/r/1273449 (https://phabricator.wikimedia.org/T333143) (owner: ''Jelto)'
2026-04-17 07:05:07 <wikibugs> 'SRE, ''Infrastructure-Foundations, ''Patch-For-Review, ''Release-Engineering-Team (Radar), ''User-notice: Sunsetting mirrors.wikimedia.org - https://phabricator.wikimedia.org/T416707#11832582 (''Nemoralis)'
2026-04-17 07:10:48 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1263 (T419635)', diff saved to https://phabricator.wikimedia.org/P91025 and previous config saved to /var/cache/conftool/dbconfig/20260417-071048-fceratto.json
2026-04-17 07:10:52 <stashbot> T419635: Drop il_to column from imagelinks table in wmf production - https://phabricator.wikimedia.org/T419635
2026-04-17 07:11:05 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 12:00:00 on dbstore1007.eqiad.wmnet with reason: Maintenance
2026-04-17 07:25:16 <wikibugs> 'SRE, ''Ganeti, ''Infrastructure-Foundations: Migrating eqsin to routed Ganeti - https://phabricator.wikimedia.org/T421863#11832624 (''MoritzMuehlenhoff)'
2026-04-17 07:25:59 <jinxer-wm> FIRING: KubernetesDeploymentUnavailableReplicas: ...
2026-04-17 07:25:59 <jinxer-wm> Deployment linkrecommendation-internal in linkrecommendation at eqiad has persistently unavailable replicas - https://wikitech.wikimedia.org/wiki/Kubernetes/Troubleshooting#Troubleshooting_a_deployment - https://grafana.wikimedia.org/d/a260da06-259a-4ee4-9540-5cab01a246c8/kubernetes-deployment-details?var-site=eqiad&var-cluster=k8s&var-namespace=linkrecommendation&var-deployment=linkrecommendation-internal - ...
2026-04-17 07:25:59 <jinxer-wm> https://alerts.wikimedia.org/?q=alertname%3DKubernetesDeploymentUnavailableReplicas
2026-04-17 07:32:15 <wikibugs> ('CR) ''Elukey: [C:''+1] Remove Puppet 5 support from Spicerack [software/spicerack] - ''https://gerrit.wikimedia.org/r/1240877 (https://phabricator.wikimedia.org/T365798) (owner: ''Muehlenhoff)'
2026-04-17 07:33:53 <logmsgbot> !log marostegui@cumin1003 END (PASS) - Cookbook sre.mysql.pool (exit_code=0) pool db1201: after reimage to trixie
2026-04-17 07:44:59 <wikibugs> ('CR) ''Brouberol: [C:''+1] "Nothing to add on top of what otto said! Great work!" [docker-images/production-images] - ''https://gerrit.wikimedia.org/r/1272726 (https://phabricator.wikimedia.org/T418525) (owner: ''Atsuko)'
2026-04-17 07:53:29 <wikibugs> ('PS1) ''Daniel Kinzler: rest gateway: add more known cg-nat addresses [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273510'
2026-04-17 07:53:47 <wikibugs> ('PS1) ''Ayounsi: eqsin: add routed ganeti customer [homer/public] - ''https://gerrit.wikimedia.org/r/1273511 (https://phabricator.wikimedia.org/T421863)'
2026-04-17 07:54:09 <wikibugs> ('CR) ''Elukey: ipmi: rework how to use a different user (''1 comment) [software/spicerack] - ''https://gerrit.wikimedia.org/r/1271631 (https://phabricator.wikimedia.org/T418929) (owner: ''Elukey)'
2026-04-17 07:59:13 <wikibugs> ('CR) ''Ayounsi: [C:''+2] eqsin: add routed ganeti customer [homer/public] - ''https://gerrit.wikimedia.org/r/1273511 (https://phabricator.wikimedia.org/T421863) (owner: ''Ayounsi)'
2026-04-17 07:59:46 <wikibugs> ('CR) ''Muehlenhoff: "LGTM" [homer/public] - ''https://gerrit.wikimedia.org/r/1273511 (https://phabricator.wikimedia.org/T421863) (owner: ''Ayounsi)'
2026-04-17 08:00:50 <wikibugs> ('Merged) ''jenkins-bot: eqsin: add routed ganeti customer [homer/public] - ''https://gerrit.wikimedia.org/r/1273511 (https://phabricator.wikimedia.org/T421863) (owner: ''Ayounsi)'
2026-04-17 08:09:10 <jinxer-wm> FIRING: [2x] GanetiBGPDown: BGP session down between ganeti5007 and cr2-eqsin - group Ganeti4 - https://wikitech.wikimedia.org/wiki/Ganeti#GanetiBGPDown - https://alerts.wikimedia.org/?q=alertname%3DGanetiBGPDown
2026-04-17 08:09:25 <wikibugs> ('CR) ''Majavah: [C:''+1] Switch Cloud VPS to deb.debian.org [puppet] - ''https://gerrit.wikimedia.org/r/1273441 (https://phabricator.wikimedia.org/T416707) (owner: ''Muehlenhoff)'
2026-04-17 08:10:53 <wikibugs> ('CR) ''Majavah: Openstack: use debian.net repo rather than the wmf-hosted repo (''1 comment) [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598) (owner: ''Andrew Bogott)'
2026-04-17 08:14:10 <jinxer-wm> FIRING: [4x] GanetiBGPDown: BGP session down between ganeti5007 and cr2-eqsin - group Ganeti4 - https://wikitech.wikimedia.org/wiki/Ganeti#GanetiBGPDown - https://alerts.wikimedia.org/?q=alertname%3DGanetiBGPDown
2026-04-17 08:17:22 <wikibugs> 'SRE, ''Infrastructure-Foundations: Failing Trixie VM installations on routed Ganeti - https://phabricator.wikimedia.org/T422596#11832695 (''MoritzMuehlenhoff) This turned out to be also reproducible on classic Ganeti and after some painful debugging given the very early failure (approx 1.5 seconds after Linu...'
2026-04-17 08:18:02 <wikibugs> 'SRE, ''Infrastructure-Foundations: Failing Trixie VM installations on routed Ganeti - https://phabricator.wikimedia.org/T422596#11832697 (''MoritzMuehlenhoff)'
2026-04-17 08:21:40 <wikibugs> ('CR) ''Muehlenhoff: [C:''+2] Remove Puppet 5 support from Spicerack [software/spicerack] - ''https://gerrit.wikimedia.org/r/1240877 (https://phabricator.wikimedia.org/T365798) (owner: ''Muehlenhoff)'
2026-04-17 08:27:00 <wikibugs> ('PS4) ''Atsuko: flink: Install flink in blubber-compatible venv [docker-images/production-images] - ''https://gerrit.wikimedia.org/r/1272726 (https://phabricator.wikimedia.org/T418525)'
2026-04-17 08:33:22 <wikibugs> ('CR) ''DCausse: "I908966a32fc264c5084719337812ca303bac509c might make this patch useless since it removes space-discount" [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1267130 (https://phabricator.wikimedia.org/T420427) (owner: ''DCausse)'
2026-04-17 08:33:56 <wikibugs> ('Abandoned) ''DCausse: search: add space-discount for wikidata custom prefix search profiles [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1267130 (https://phabricator.wikimedia.org/T420427) (owner: ''DCausse)'
2026-04-17 08:37:58 <jinxer-wm> FIRING: [4x] ProbeDown: Service text-https:443 has failed probes (http_text-https_ip4) #page - https://grafana.wikimedia.org/d/O0nHhdhnz/network-probes-overview?var-job=probes/service&var-module=All - https://alerts.wikimedia.org/?q=alertname%3DProbeDown
2026-04-17 08:37:58 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] START helmfile.d/admin 'sync'.
2026-04-17 08:38:07 <icinga-wm> PROBLEM - SSH on cp3072 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 08:38:07 <icinga-wm> PROBLEM - SSH on cp3070 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 08:38:07 <icinga-wm> PROBLEM - SSH on cp3068 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 08:38:07 <icinga-wm> PROBLEM - SSH on cp3067 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 08:38:07 <icinga-wm> PROBLEM - SSH on cp3073 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 08:38:07 <icinga-wm> PROBLEM - SSH on cp3066 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 08:38:09 <icinga-wm> PROBLEM - SSH on cp3069 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 08:38:09 <icinga-wm> PROBLEM - SSH on cp3071 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 08:38:13 <icinga-wm> PROBLEM - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3072 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:38:13 <icinga-wm> PROBLEM - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3070 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:38:13 <icinga-wm> PROBLEM - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3071 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:38:13 <icinga-wm> PROBLEM - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3066 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:38:13 <icinga-wm> PROBLEM - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3068 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:38:13 <icinga-wm> PROBLEM - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3073 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:38:13 <icinga-wm> PROBLEM - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3069 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:38:27 <icinga-wm> PROBLEM - Ensure traffic_exporter for the backend instance binds on port 9122 and responds to HTTP requests on cp3070 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:38:27 <icinga-wm> PROBLEM - Ensure traffic_exporter for the backend instance binds on port 9122 and responds to HTTP requests on cp3071 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:38:27 <icinga-wm> PROBLEM - Ensure traffic_exporter for the backend instance binds on port 9122 and responds to HTTP requests on cp3072 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:38:27 <icinga-wm> PROBLEM - Ensure traffic_exporter for the backend instance binds on port 9122 and responds to HTTP requests on cp3067 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:38:27 <icinga-wm> PROBLEM - Ensure traffic_exporter for the backend instance binds on port 9122 and responds to HTTP requests on cp3066 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:38:27 <icinga-wm> PROBLEM - Ensure traffic_exporter for the backend instance binds on port 9122 and responds to HTTP requests on cp3068 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:38:27 <icinga-wm> PROBLEM - Ensure traffic_exporter for the backend instance binds on port 9122 and responds to HTTP requests on cp3069 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:38:30 <jelto> I cant reach any of our services (gerrit, grafana) from Germany
2026-04-17 08:38:48 <arnaudb> works from France
2026-04-17 08:38:48 <bjensen> !ack
2026-04-17 08:38:49 <sirenbot> 7847 (ACKED) [4x] ProbeDown sre (probes/service esams)
2026-04-17 08:38:52 <jelto> esams has problems?
2026-04-17 08:38:59 <icinga-wm> RECOVERY - SSH on cp3067 is OK: SSH OK - OpenSSH_10.0p2 Debian-7+deb13u1 (protocol 2.0) https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 08:39:17 <icinga-wm> RECOVERY - Ensure traffic_exporter for the backend instance binds on port 9122 and responds to HTTP requests on cp3067 is OK: HTTP OK: HTTP/1.0 200 OK - 37121 bytes in 0.287 second response time https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:39:45 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] DONE helmfile.d/admin 'sync'.
2026-04-17 08:39:49 <marostegui> Maybe what XioNoX mentioned about gtt?
2026-04-17 08:39:52 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] START helmfile.d/admin 'sync'.
2026-04-17 08:39:57 <icinga-wm> RECOVERY - SSH on cp3073 is OK: SSH OK - OpenSSH_10.0p2 Debian-7+deb13u1 (protocol 2.0) https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 08:40:03 <icinga-wm> RECOVERY - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3073 is OK: HTTP OK: HTTP/1.1 200 OK - 50385 bytes in 0.332 second response time https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:40:05 <icinga-wm> RECOVERY - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3072 is OK: HTTP OK: HTTP/1.1 200 OK - 50371 bytes in 1.841 second response time https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:40:18 <bjensen> hm, having a tough time opening wikitech/grafana
2026-04-17 08:40:29 <bjensen> from Ireland
2026-04-17 08:40:30 <jinxer-wm> FIRING: [8x] LibericaUnhealthyRealserverPooled: Liberica service gerrit-httpslb6_443 has 4 unhealthy realservers pooled on lvs3008:3003 - https://wikitech.wikimedia.org/wiki/Liberica#LibericaUnhealthyRealserverPooled - https://alerts.wikimedia.org/?q=alertname%3DLibericaUnhealthyRealserverPooled
2026-04-17 08:40:40 <marostegui> Works from Spain
2026-04-17 08:41:30 <jelto> with tunnelencabulator it works again
2026-04-17 08:41:46 <marostegui> Should we depool esams?
2026-04-17 08:41:50 <marostegui> But it does work for me
2026-04-17 08:41:51 <jinxer-wm> FIRING: SwaggerProbeHasFailures: Not all openapi/swagger endpoints returned healthy - https://wikitech.wikimedia.org/wiki/Runbook#https://en.wikipedia.org/api/rest_v1 - https://grafana.wikimedia.org/d/_77ik484k/openapi-swagger-endpoint-state?var-site=esams - https://alerts.wikimedia.org/?q=alertname%3DSwaggerProbeHasFailures
2026-04-17 08:42:02 <jelto> I think that was a traffic spike: https://grafana.wikimedia.org/d/O_OXJyTVk/home-w-wiki-status?orgId=1&from=now-3h&to=now&timezone=utc&refresh=5m&viewPanel=panel-2
2026-04-17 08:42:14 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] DONE helmfile.d/admin 'sync'.
2026-04-17 08:42:15 <arnaudb> oof
2026-04-17 08:42:27 <icinga-wm> PROBLEM - Ensure traffic_exporter for the backend instance binds on port 9122 and responds to HTTP requests on cp3067 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:42:27 <marostegui> Seems to be recovering?
2026-04-17 08:42:35 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] Ran 'sync' command on namespace 'edit-check' for release 'main' .
2026-04-17 08:42:58 <jinxer-wm> FIRING: NELHigh: Elevated Network Error Logging events (tcp.timed_out) #page - https://wikitech.wikimedia.org/wiki/Network_monitoring#NEL_alerts - https://logstash.wikimedia.org/goto/5c8f4ca1413eda33128e5c5a35da7e28 - https://alerts.wikimedia.org/?q=alertname%3DNELHigh
2026-04-17 08:42:58 <jinxer-wm> FIRING: [4x] NELByCountryHigh: Elevated Network Error Logging events (tcp.timed_out from DE) - https://wikitech.wikimedia.org/wiki/Network_monitoring#NEL_alerts - https://logstash.wikimedia.org/goto/5c8f4ca1413eda33128e5c5a35da7e28 - https://alerts.wikimedia.org/?q=alertname%3DNELByCountryHigh
2026-04-17 08:43:07 <icinga-wm> PROBLEM - SSH on cp3067 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 08:43:13 <icinga-wm> PROBLEM - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3072 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:43:13 <icinga-wm> PROBLEM - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3067 is CRITICAL: CRITICAL - Socket timeout after 10 seconds https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:43:27 <bjensen> i suppose that makes sense
2026-04-17 08:43:45 <marostegui> bjensen: what?
2026-04-17 08:43:58 <bjensen> the by-country alert
2026-04-17 08:44:00 <wikibugs> ('CR) ''Ayounsi: [C:''+1] "Lgtm, I also see that there is a mention of bast1003 in `modules/wmflib/spec/functions/ipresolve_spec.rb`" [puppet] - ''https://gerrit.wikimedia.org/r/1273413 (owner: ''Muehlenhoff)'
2026-04-17 08:44:05 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] START helmfile.d/admin 'sync'.
2026-04-17 08:44:17 <jinxer-wm> FIRING: [4x] JobUnavailable: Reduced availability for job probes/swagger in ops@esams - https://wikitech.wikimedia.org/wiki/Prometheus#Prometheus_job_unavailable - https://grafana.wikimedia.org/d/NEJu05xZz/prometheus-targets - https://alerts.wikimedia.org/?q=alertname%3DJobUnavailable
2026-04-17 08:45:03 <bjensen> is depooling esams likely to intensify the problem?
2026-04-17 08:45:05 <icinga-wm> RECOVERY - SSH on cp3072 is OK: SSH OK - OpenSSH_10.0p2 Debian-7+deb13u1 (protocol 2.0) https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 08:45:05 <icinga-wm> RECOVERY - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3072 is OK: HTTP OK: HTTP/1.1 200 OK - 50375 bytes in 2.672 second response time https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:45:17 <icinga-wm> RECOVERY - Ensure traffic_exporter for the backend instance binds on port 9122 and responds to HTTP requests on cp3072 is OK: HTTP OK: HTTP/1.0 200 OK - 37130 bytes in 0.291 second response time https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:45:53 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] DONE helmfile.d/admin 'sync'.
2026-04-17 08:45:57 <icinga-wm> RECOVERY - SSH on cp3067 is OK: SSH OK - OpenSSH_10.0p2 Debian-7+deb13u1 (protocol 2.0) https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 08:46:03 <icinga-wm> RECOVERY - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3067 is OK: HTTP OK: HTTP/1.1 200 OK - 50372 bytes in 0.329 second response time https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:46:05 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] START helmfile.d/admin 'sync'.
2026-04-17 08:46:17 <icinga-wm> RECOVERY - Ensure traffic_exporter for the backend instance binds on port 9122 and responds to HTTP requests on cp3067 is OK: HTTP OK: HTTP/1.0 200 OK - 37121 bytes in 0.288 second response time https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:46:53 <wikibugs> ('PS1) ''Slyngshede: data: align config [puppet] - ''https://gerrit.wikimedia.org/r/1273658'
2026-04-17 08:46:57 <icinga-wm> RECOVERY - SSH on cp3066 is OK: SSH OK - OpenSSH_10.0p2 Debian-7+deb13u1 (protocol 2.0) https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 08:47:03 <icinga-wm> RECOVERY - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3066 is OK: HTTP OK: HTTP/1.1 200 OK - 50378 bytes in 0.329 second response time https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:47:17 <icinga-wm> RECOVERY - Ensure traffic_exporter for the backend instance binds on port 9122 and responds to HTTP requests on cp3066 is OK: HTTP OK: HTTP/1.0 200 OK - 37129 bytes in 0.288 second response time https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:47:57 <jinxer-wm> FIRING: [4x] ProbeDown: Service text-https:443 has failed probes (http_text-https_ip4) #page - https://grafana.wikimedia.org/d/O0nHhdhnz/network-probes-overview?var-job=probes/service&var-module=All - https://alerts.wikimedia.org/?q=alertname%3DProbeDown
2026-04-17 08:47:58 <jinxer-wm> FIRING: [2x] NELHigh: Elevated Network Error Logging events (tcp.address_unreachable) #page - https://wikitech.wikimedia.org/wiki/Network_monitoring#NEL_alerts - https://logstash.wikimedia.org/goto/5c8f4ca1413eda33128e5c5a35da7e28 - https://alerts.wikimedia.org/?q=alertname%3DNELHigh
2026-04-17 08:47:59 <jinxer-wm> FIRING: [6x] NELByCountryHigh: Elevated Network Error Logging events (tcp.address_unreachable from DE) - https://wikitech.wikimedia.org/wiki/Network_monitoring#NEL_alerts - https://logstash.wikimedia.org/goto/5c8f4ca1413eda33128e5c5a35da7e28 - https://alerts.wikimedia.org/?q=alertname%3DNELByCountryHigh
2026-04-17 08:48:06 <marostegui> !ack
2026-04-17 08:48:07 <sirenbot> All incidents are already acked.
2026-04-17 08:48:26 <bjensen> !incidents
2026-04-17 08:48:26 <sirenbot> 7847 (ACKED) [4x] ProbeDown sre (probes/service esams)
2026-04-17 08:48:26 <sirenbot> 7848 (ACKED) NELHigh sre (thanos-rule@main tcp.timed_out)
2026-04-17 08:48:26 <sirenbot> 7846 (RESOLVED) ProbeDown sre (2001:df2:e500:ed1a::1 ip6 text:80 probes/service http_text_ip6 eqsin)
2026-04-17 08:48:27 <sirenbot> 7845 (RESOLVED) TransitPeeringTransportOutSaturation network sre (cr1-eqiad:9804 Transit: NTT (234630) {#3475} xe-3/1/6 gnmi eqiad)
2026-04-17 08:48:27 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] DONE helmfile.d/admin 'sync'.
2026-04-17 08:48:27 <sirenbot> 7844 (RESOLVED) TransitPeeringTransportOutSaturation network sre (cr1-eqiad:9804 Transit: Lumen (442550281) {#3867} xe-3/3/2 gnmi eqiad)
2026-04-17 08:48:27 <sirenbot> 7843 (RESOLVED) TransitPeeringTransportOutSaturation network sre (cr1-codfw:9804 Transport: cr4-ulsfo:xe-0/1/1 (Lumen, 442550294) {#12252_12295-1} xe-1/1/1:0 gnmi codfw)
2026-04-17 08:49:17 <jinxer-wm> FIRING: [4x] JobUnavailable: Reduced availability for job probes/swagger in ops@esams - https://wikitech.wikimedia.org/wiki/Prometheus#Prometheus_job_unavailable - https://grafana.wikimedia.org/d/NEJu05xZz/prometheus-targets - https://alerts.wikimedia.org/?q=alertname%3DJobUnavailable
2026-04-17 08:50:30 <jinxer-wm> FIRING: [8x] LibericaUnhealthyRealserverPooled: Liberica service gerrit-httpslb6_443 has 3 unhealthy realservers pooled on lvs3008:3003 - https://wikitech.wikimedia.org/wiki/Liberica#LibericaUnhealthyRealserverPooled - https://alerts.wikimedia.org/?q=alertname%3DLibericaUnhealthyRealserverPooled
2026-04-17 08:50:42 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] Ran 'sync' command on namespace 'edit-check' for release 'main' .
2026-04-17 08:51:16 <logmsgbot> !log cmooney@cumin1003 START - Cookbook sre.dns.admin DNS admin: depool esams [reason: no reason specified, no task ID specified]
2026-04-17 08:51:19 <logmsgbot> !log cmooney@cumin1003 END (PASS) - Cookbook sre.dns.admin (exit_code=0) DNS admin: depool esams [reason: no reason specified, no task ID specified]
2026-04-17 08:51:42 <topranks> !log depool esams due to connectivity issues
2026-04-17 08:51:43 <stashbot> Logged the message at https://wikitech.wikimedia.org/wiki/Server_Admin_Log
2026-04-17 08:51:51 <jinxer-wm> RESOLVED: SwaggerProbeHasFailures: Not all openapi/swagger endpoints returned healthy - https://wikitech.wikimedia.org/wiki/Runbook#https://en.wikipedia.org/api/rest_v1 - https://grafana.wikimedia.org/d/_77ik484k/openapi-swagger-endpoint-state?var-site=esams - https://alerts.wikimedia.org/?q=alertname%3DSwaggerProbeHasFailures
2026-04-17 08:52:57 <jinxer-wm> FIRING: [4x] ProbeDown: Service text-https:443 has failed probes (http_text-https_ip4) #page - https://grafana.wikimedia.org/d/O0nHhdhnz/network-probes-overview?var-job=probes/service&var-module=All - https://alerts.wikimedia.org/?q=alertname%3DProbeDown
2026-04-17 08:53:07 <jinxer-wm> FIRING: [4x] ProbeDown: Service aqs1010-a:7000 has failed probes (tcp_cassandra_a_ssl_ip4) - https://alerts.wikimedia.org/?q=alertname%3DProbeDown
2026-04-17 08:53:25 <icinga-wm> RECOVERY - Ensure traffic_exporter for the backend instance binds on port 9122 and responds to HTTP requests on cp3070 is OK: HTTP OK: HTTP/1.0 200 OK - 37119 bytes in 7.573 second response time https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:53:50 <wikibugs> ('PS2) ''Dpogorzelski: knative-serving: update chart to 1.21.1 [deployment-charts] - ''https://gerrit.wikimedia.org/r/1271709'
2026-04-17 08:53:57 <icinga-wm> RECOVERY - SSH on cp3070 is OK: SSH OK - OpenSSH_10.0p2 Debian-7+deb13u1 (protocol 2.0) https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 08:54:03 <icinga-wm> RECOVERY - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3070 is OK: HTTP OK: HTTP/1.1 200 OK - 50370 bytes in 0.329 second response time https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 08:54:17 <jinxer-wm> RESOLVED: [4x] JobUnavailable: Reduced availability for job probes/swagger in ops@esams - https://wikitech.wikimedia.org/wiki/Prometheus#Prometheus_job_unavailable - https://grafana.wikimedia.org/d/NEJu05xZz/prometheus-targets - https://alerts.wikimedia.org/?q=alertname%3DJobUnavailable
2026-04-17 08:55:30 <jinxer-wm> FIRING: [8x] LibericaUnhealthyRealserverPooled: Liberica service gerrit-httpslb6_443 has 3 unhealthy realservers pooled on lvs3008:3003 - https://wikitech.wikimedia.org/wiki/Liberica#LibericaUnhealthyRealserverPooled - https://alerts.wikimedia.org/?q=alertname%3DLibericaUnhealthyRealserverPooled
2026-04-17 08:56:13 <wikibugs> ('PS1) ''Dpogorzelski: kserve-resources: fix securityContext propagation [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273664 (https://phabricator.wikimedia.org/T423149)'
2026-04-17 08:57:54 <wikibugs> ('CR) ''CI reject: [V:''-1] kserve-resources: fix securityContext propagation [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273664 (https://phabricator.wikimedia.org/T423149) (owner: ''Dpogorzelski)'
2026-04-17 08:57:58 <jinxer-wm> RESOLVED: [2x] NELHigh: Elevated Network Error Logging events (tcp.address_unreachable) #page - https://wikitech.wikimedia.org/wiki/Network_monitoring#NEL_alerts - https://logstash.wikimedia.org/goto/5c8f4ca1413eda33128e5c5a35da7e28 - https://alerts.wikimedia.org/?q=alertname%3DNELHigh
2026-04-17 08:57:59 <jinxer-wm> RESOLVED: [6x] NELByCountryHigh: Elevated Network Error Logging events (tcp.address_unreachable from DE) - https://wikitech.wikimedia.org/wiki/Network_monitoring#NEL_alerts - https://logstash.wikimedia.org/goto/5c8f4ca1413eda33128e5c5a35da7e28 - https://alerts.wikimedia.org/?q=alertname%3DNELByCountryHigh
2026-04-17 09:05:09 <icinga-wm> RECOVERY - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3069 is OK: HTTP OK: HTTP/1.1 200 OK - 50375 bytes in 6.214 second response time https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 09:05:17 <icinga-wm> RECOVERY - Ensure traffic_exporter for the backend instance binds on port 9122 and responds to HTTP requests on cp3069 is OK: HTTP OK: HTTP/1.0 200 OK - 37126 bytes in 0.290 second response time https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 09:05:59 <icinga-wm> RECOVERY - SSH on cp3069 is OK: SSH OK - OpenSSH_10.0p2 Debian-7+deb13u1 (protocol 2.0) https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 09:07:50 <wikibugs> ('CR) ''Elukey: "Really sorry for all the extra work that I caused with the suggestion of removing this, at this point we need to just add the workloadType" [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273664 (https://phabricator.wikimedia.org/T423149) (owner: ''Dpogorzelski)'
2026-04-17 09:08:00 <wikibugs> ('CR) ''Atsuko: flink: Install flink in blubber-compatible venv (''1 comment) [docker-images/production-images] - ''https://gerrit.wikimedia.org/r/1272726 (https://phabricator.wikimedia.org/T418525) (owner: ''Atsuko)'
2026-04-17 09:08:42 <jinxer-wm> FIRING: [2x] SystemdUnitFailed: wmf_auto_restart_prometheus-blazegraph-exporter-wdqs-blazegraph.service on wdqs1012:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 09:10:30 <jinxer-wm> RESOLVED: [4x] LibericaUnhealthyRealserverPooled: Liberica service text-httpslb6_443 has 3 unhealthy realservers pooled on lvs3008:3003 - https://wikitech.wikimedia.org/wiki/Liberica#LibericaUnhealthyRealserverPooled - https://alerts.wikimedia.org/?q=alertname%3DLibericaUnhealthyRealserverPooled
2026-04-17 09:12:41 <wikibugs> ('CR) ''Elukey: "Even if it makes no sense, the current CRD allows extra fields, it doesn't really validate them. So it should be ok now." [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273664 (https://phabricator.wikimedia.org/T423149) (owner: ''Dpogorzelski)'
2026-04-17 09:13:39 <wikibugs> ('CR) ''Muehlenhoff: [C:''+1] "Looks good" [puppet] - ''https://gerrit.wikimedia.org/r/1273658 (owner: ''Slyngshede)'
2026-04-17 09:13:46 <wikibugs> ('PS1) ''Jcrespo: backup: Ignore /srv/docker from srv-deployment backups, move cluster mgmt [puppet] - ''https://gerrit.wikimedia.org/r/1273676 (https://phabricator.wikimedia.org/T423619)'
2026-04-17 09:14:01 <wikibugs> ('PS2) ''Jcrespo: backup: Ignore /srv/docker from srv-deployment backups, move cluster mgmt [puppet] - ''https://gerrit.wikimedia.org/r/1273676 (https://phabricator.wikimedia.org/T423619)'
2026-04-17 09:14:10 <wikibugs> ('CR) ''Jcrespo: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273676 (https://phabricator.wikimedia.org/T423619) (owner: ''Jcrespo)'
2026-04-17 09:14:12 <marostegui> !incidents
2026-04-17 09:14:12 <sirenbot> 7847 (ACKED) [4x] ProbeDown sre (probes/service esams)
2026-04-17 09:14:12 <sirenbot> 7848 (RESOLVED) NELHigh sre (thanos-rule@main tcp.timed_out)
2026-04-17 09:14:13 <sirenbot> 7846 (RESOLVED) ProbeDown sre (2001:df2:e500:ed1a::1 ip6 text:80 probes/service http_text_ip6 eqsin)
2026-04-17 09:14:13 <sirenbot> 7845 (RESOLVED) TransitPeeringTransportOutSaturation network sre (cr1-eqiad:9804 Transit: NTT (234630) {#3475} xe-3/1/6 gnmi eqiad)
2026-04-17 09:14:13 <sirenbot> 7844 (RESOLVED) TransitPeeringTransportOutSaturation network sre (cr1-eqiad:9804 Transit: Lumen (442550281) {#3867} xe-3/3/2 gnmi eqiad)
2026-04-17 09:16:25 <jinxer-wm> FIRING: [2x] SystemdUnitFailed: send_tile_invalidations.service on maps1011:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 09:16:51 <wikibugs> ('CR) ''Brouberol: [C:''+1] flink: Install flink in blubber-compatible venv [docker-images/production-images] - ''https://gerrit.wikimedia.org/r/1272726 (https://phabricator.wikimedia.org/T418525) (owner: ''Atsuko)'
2026-04-17 09:21:00 <wikibugs> ('PS1) ''Jelto: gerrit: migrate gerrit2003 data to /srv/gerrit [puppet] - ''https://gerrit.wikimedia.org/r/1273683 (https://phabricator.wikimedia.org/T333143)'
2026-04-17 09:21:27 <wikibugs> ('CR) ''Jelto: [C:''-1] "should not be merged yet" [puppet] - ''https://gerrit.wikimedia.org/r/1273683 (https://phabricator.wikimedia.org/T333143) (owner: ''Jelto)'
2026-04-17 09:21:34 <wikibugs> ('CR) ''Atsuko: [C:''+2] flink: Install flink in blubber-compatible venv [docker-images/production-images] - ''https://gerrit.wikimedia.org/r/1272726 (https://phabricator.wikimedia.org/T418525) (owner: ''Atsuko)'
2026-04-17 09:25:04 <wikibugs> 'SRE-tools, ''Infrastructure-Foundations, ''Data-Platform-SRE (2026-03-27 - 2026-04-17): debmonitor-client crashes for growthbook image - https://phabricator.wikimedia.org/T423413#11832785 (''brouberol) a:''brouberol'
2026-04-17 09:25:34 <wikibugs> ('CR) ''Atsuko: [V:''+2 C:''+2] flink: Install flink in blubber-compatible venv [docker-images/production-images] - ''https://gerrit.wikimedia.org/r/1272726 (https://phabricator.wikimedia.org/T418525) (owner: ''Atsuko)'
2026-04-17 09:26:13 <wikibugs> 'SRE-tools, ''Infrastructure-Foundations, ''Data-Platform-SRE (2026-03-27 - 2026-04-17): debmonitor-client crashes for growthbook image - https://phabricator.wikimedia.org/T423413#11832790 (''brouberol) @elukey I'd appreciated guidance as to how to build the new `docker-report` deb package, and deploy it. T...'
2026-04-17 09:29:35 <wikibugs> ('CR) ''Jcrespo: "Please have a look and send amends/comments." [puppet] - ''https://gerrit.wikimedia.org/r/1273676 (https://phabricator.wikimedia.org/T423619) (owner: ''Jcrespo)'
2026-04-17 09:32:47 <icinga-wm> PROBLEM - Host cp3068 is DOWN: PING CRITICAL - Packet loss = 100%
2026-04-17 09:34:35 <icinga-wm> RECOVERY - Host cp3068 is UP: PING OK - Packet loss = 0%, RTA = 80.14 ms
2026-04-17 09:34:37 <icinga-wm> PROBLEM - haproxy process on cp3068 is CRITICAL: PROCS CRITICAL: 0 processes with command name haproxy https://wikitech.wikimedia.org/wiki/HAProxy
2026-04-17 09:34:57 <icinga-wm> RECOVERY - SSH on cp3068 is OK: SSH OK - OpenSSH_10.0p2 Debian-7+deb13u1 (protocol 2.0) https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 09:35:07 <icinga-wm> RECOVERY - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3068 is OK: HTTP OK: HTTP/1.1 200 OK - 48162 bytes in 0.324 second response time https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 09:35:17 <icinga-wm> RECOVERY - Ensure traffic_exporter for the backend instance binds on port 9122 and responds to HTTP requests on cp3068 is OK: HTTP OK: HTTP/1.0 200 OK - 36142 bytes in 0.280 second response time https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 09:35:20 <logmsgbot> !log ayounsi@cumin1003 START - Cookbook sre.network.tls for network device lsw1-e3-codfw
2026-04-17 09:35:21 <icinga-wm> PROBLEM - HAProxy HTTPS wikiworkshop.org ECDSA on cp3068 is CRITICAL: SSL CRITICAL - failed to connect or SSL handshake:Connection refused https://wikitech.wikimedia.org/wiki/HTTPS
2026-04-17 09:35:21 <icinga-wm> PROBLEM - HAProxy HTTPS wikipedia25.org ECDSA on cp3068 is CRITICAL: SSL CRITICAL - failed to connect or SSL handshake:Connection refused https://wikitech.wikimedia.org/wiki/HTTPS
2026-04-17 09:35:21 <icinga-wm> PROBLEM - HAProxy HTTPS wikipedia.org ECDSA on cp3068 is CRITICAL: SSL CRITICAL - failed to connect or SSL handshake:Connection refused https://wikitech.wikimedia.org/wiki/HTTPS
2026-04-17 09:35:27 <logmsgbot> !log ayounsi@cumin1003 END (PASS) - Cookbook sre.network.tls (exit_code=0) for network device lsw1-e3-codfw
2026-04-17 09:35:34 <logmsgbot> !log ayounsi@cumin1003 START - Cookbook sre.network.tls for network device lsw1-e1-codfw
2026-04-17 09:35:41 <logmsgbot> !log ayounsi@cumin1003 END (PASS) - Cookbook sre.network.tls (exit_code=0) for network device lsw1-e1-codfw
2026-04-17 09:35:49 <logmsgbot> !log ayounsi@cumin1003 START - Cookbook sre.network.tls for network device ssw1-e1-codfw
2026-04-17 09:35:56 <logmsgbot> !log ayounsi@cumin1003 END (PASS) - Cookbook sre.network.tls (exit_code=0) for network device ssw1-e1-codfw
2026-04-17 09:36:04 <logmsgbot> !log ayounsi@cumin1003 START - Cookbook sre.network.tls for network device ssw1-f1-codfw
2026-04-17 09:36:11 <logmsgbot> !log ayounsi@cumin1003 END (PASS) - Cookbook sre.network.tls (exit_code=0) for network device ssw1-f1-codfw
2026-04-17 09:36:20 <logmsgbot> !log ayounsi@cumin1003 START - Cookbook sre.network.tls for network device lsw1-f3-codfw
2026-04-17 09:36:27 <logmsgbot> !log ayounsi@cumin1003 END (PASS) - Cookbook sre.network.tls (exit_code=0) for network device lsw1-f3-codfw
2026-04-17 09:38:21 <icinga-wm> RECOVERY - HAProxy HTTPS wikiworkshop.org ECDSA on cp3068 is OK: SSL OK - Certificate wikiworkshop.org contains all required SANs:Certificate wikiworkshop.org (ECDSA) valid until 2026-05-13 04:44:41 +0000 (expires in 25 days) https://wikitech.wikimedia.org/wiki/HTTPS
2026-04-17 09:38:21 <icinga-wm> RECOVERY - HAProxy HTTPS wikipedia.org ECDSA on cp3068 is OK: SSL OK - Certificate *.wikipedia.org contains all required SANs:Certificate *.wikipedia.org (ECDSA) valid until 2026-07-06 20:52:29 +0000 (expires in 80 days) https://wikitech.wikimedia.org/wiki/HTTPS
2026-04-17 09:38:21 <icinga-wm> RECOVERY - HAProxy HTTPS wikipedia25.org ECDSA on cp3068 is OK: SSL OK - Certificate wikipedia25.org contains all required SANs:Certificate wikipedia25.org (ECDSA) valid until 2026-06-06 06:58:50 +0000 (expires in 49 days) https://wikitech.wikimedia.org/wiki/HTTPS
2026-04-17 09:38:38 <wikibugs> ('PS2) ''Jcrespo: dbbackups: Backup only regularly clusters 32 & 33, the read-write ones [puppet] - ''https://gerrit.wikimedia.org/r/1271730 (https://phabricator.wikimedia.org/T421729)'
2026-04-17 09:38:38 <wikibugs> ('PS3) ''Jcrespo: backup: Ignore /srv/docker from srv-deployment backups, move cluster mgmt [puppet] - ''https://gerrit.wikimedia.org/r/1273676 (https://phabricator.wikimedia.org/T423619)'
2026-04-17 09:38:38 <wikibugs> ('PS1) ''Jcrespo: backup: Remove references to ips of hosts about to be decommissioned [puppet] - ''https://gerrit.wikimedia.org/r/1273699 (https://phabricator.wikimedia.org/T422851)'
2026-04-17 09:38:39 <icinga-wm> RECOVERY - haproxy process on cp3068 is OK: PROCS OK: 2 processes with command name haproxy https://wikitech.wikimedia.org/wiki/HAProxy
2026-04-17 09:38:51 <wikibugs> 'SRE, ''SRE-Access-Requests, ''Data-Engineering: Requesting access to analytics_privatedata_users and SQL Lab for AnnieKim_WMDE - https://phabricator.wikimedia.org/T420500#11832838 (''Martyn.ranyard) I approve this, but I think @Scott_French or someone else on that team still needs to add you to the gro...'
2026-04-17 09:39:13 <wikibugs> ('PS2) ''Jcrespo: backup: Remove references to ips of hosts about to be decommissioned [puppet] - ''https://gerrit.wikimedia.org/r/1273699 (https://phabricator.wikimedia.org/T422851)'
2026-04-17 09:39:26 <wikibugs> ('PS4) ''Jcrespo: backup: Ignore /srv/docker from srv-deployment backups, move cluster mgmt [puppet] - ''https://gerrit.wikimedia.org/r/1273676 (https://phabricator.wikimedia.org/T423619)'
2026-04-17 09:39:57 <jinxer-wm> RESOLVED: [3x] CertAlmostExpired: Certificate for service lsw1-e1-codfw.mgmt.codfw.wmnet:32767 is about to expire - TODO - https://alerts.wikimedia.org/?q=alertname%3DCertAlmostExpired
2026-04-17 09:43:59 <icinga-wm> PROBLEM - Host cp3071 is DOWN: PING CRITICAL - Packet loss = 100%
2026-04-17 09:44:34 <moritzm> !log initialise eqsin02 Ganeti cluster T421863
2026-04-17 09:44:37 <stashbot> Logged the message at https://wikitech.wikimedia.org/wiki/Server_Admin_Log
2026-04-17 09:44:37 <icinga-wm> RECOVERY - Host cp3071 is UP: PING OK - Packet loss = 0%, RTA = 80.19 ms
2026-04-17 09:44:37 <icinga-wm> PROBLEM - haproxy process on cp3071 is CRITICAL: PROCS CRITICAL: 0 processes with command name haproxy https://wikitech.wikimedia.org/wiki/HAProxy
2026-04-17 09:44:37 <icinga-wm> PROBLEM - statsv Varnishkafka log producer on cp3071 is CRITICAL: PROCS CRITICAL: 0 processes with args /usr/bin/varnishkafka -S /etc/varnishkafka/statsv.conf https://wikitech.wikimedia.org/wiki/Analytics/Systems/Varnishkafka
2026-04-17 09:44:38 <stashbot> T421863: Migrating eqsin to routed Ganeti - https://phabricator.wikimedia.org/T421863
2026-04-17 09:44:59 <icinga-wm> RECOVERY - SSH on cp3071 is OK: SSH OK - OpenSSH_10.0p2 Debian-7+deb13u1 (protocol 2.0) https://wikitech.wikimedia.org/wiki/SSH/monitoring
2026-04-17 09:45:05 <icinga-wm> RECOVERY - Ensure traffic_manager binds on 3128 and responds to HTTP requests on cp3071 is OK: HTTP OK: HTTP/1.1 200 OK - 48144 bytes in 0.323 second response time https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 09:45:17 <icinga-wm> RECOVERY - Ensure traffic_exporter for the backend instance binds on port 9122 and responds to HTTP requests on cp3071 is OK: HTTP OK: HTTP/1.0 200 OK - 36141 bytes in 0.281 second response time https://wikitech.wikimedia.org/wiki/Apache_Traffic_Server
2026-04-17 09:45:29 <icinga-wm> PROBLEM - HAProxy HTTPS wikiworkshop.org ECDSA on cp3071 is CRITICAL: SSL CRITICAL - failed to connect or SSL handshake:Connection refused https://wikitech.wikimedia.org/wiki/HTTPS
2026-04-17 09:45:29 <icinga-wm> PROBLEM - HAProxy HTTPS wikipedia25.org ECDSA on cp3071 is CRITICAL: SSL CRITICAL - failed to connect or SSL handshake:Connection refused https://wikitech.wikimedia.org/wiki/HTTPS
2026-04-17 09:45:29 <icinga-wm> PROBLEM - HAProxy HTTPS wikipedia.org ECDSA on cp3071 is CRITICAL: SSL CRITICAL - failed to connect or SSL handshake:Connection refused https://wikitech.wikimedia.org/wiki/HTTPS
2026-04-17 09:45:37 <icinga-wm> RECOVERY - statsv Varnishkafka log producer on cp3071 is OK: PROCS OK: 1 process with args /usr/bin/varnishkafka -S /etc/varnishkafka/statsv.conf https://wikitech.wikimedia.org/wiki/Analytics/Systems/Varnishkafka
2026-04-17 09:47:57 <jinxer-wm> RESOLVED: [2x] ProbeDown: Service text:80 has failed probes (http_text_ip4) #page - https://wikitech.wikimedia.org/wiki/Runbook#text:80 - https://grafana.wikimedia.org/d/O0nHhdhnz/network-probes-overview?var-job=probes/service&var-module=All - https://alerts.wikimedia.org/?q=alertname%3DProbeDown
2026-04-17 09:48:05 <XioNoX> nice
2026-04-17 09:48:07 <jinxer-wm> FIRING: [4x] ProbeDown: Service aqs1010-a:7000 has failed probes (tcp_cassandra_a_ssl_ip4) - https://alerts.wikimedia.org/?q=alertname%3DProbeDown
2026-04-17 09:48:29 <icinga-wm> RECOVERY - HAProxy HTTPS wikiworkshop.org ECDSA on cp3071 is OK: SSL OK - Certificate wikiworkshop.org contains all required SANs:Certificate wikiworkshop.org (ECDSA) valid until 2026-05-13 04:44:41 +0000 (expires in 25 days) https://wikitech.wikimedia.org/wiki/HTTPS
2026-04-17 09:48:29 <icinga-wm> RECOVERY - HAProxy HTTPS wikipedia25.org ECDSA on cp3071 is OK: SSL OK - Certificate wikipedia25.org contains all required SANs:Certificate wikipedia25.org (ECDSA) valid until 2026-06-06 06:58:50 +0000 (expires in 49 days) https://wikitech.wikimedia.org/wiki/HTTPS
2026-04-17 09:48:29 <icinga-wm> RECOVERY - HAProxy HTTPS wikipedia.org ECDSA on cp3071 is OK: SSL OK - Certificate *.wikipedia.org contains all required SANs:Certificate *.wikipedia.org (ECDSA) valid until 2026-07-06 20:52:29 +0000 (expires in 80 days) https://wikitech.wikimedia.org/wiki/HTTPS
2026-04-17 09:48:39 <icinga-wm> RECOVERY - haproxy process on cp3071 is OK: PROCS OK: 2 processes with command name haproxy https://wikitech.wikimedia.org/wiki/HAProxy
2026-04-17 09:48:42 <marostegui> !incidents
2026-04-17 09:48:43 <sirenbot> 7847 (RESOLVED) [4x] ProbeDown sre (probes/service esams)
2026-04-17 09:48:43 <sirenbot> 7848 (RESOLVED) NELHigh sre (thanos-rule@main tcp.timed_out)
2026-04-17 09:48:43 <sirenbot> 7846 (RESOLVED) ProbeDown sre (2001:df2:e500:ed1a::1 ip6 text:80 probes/service http_text_ip6 eqsin)
2026-04-17 09:48:43 <sirenbot> 7845 (RESOLVED) TransitPeeringTransportOutSaturation network sre (cr1-eqiad:9804 Transit: NTT (234630) {#3475} xe-3/1/6 gnmi eqiad)
2026-04-17 09:48:43 <sirenbot> 7844 (RESOLVED) TransitPeeringTransportOutSaturation network sre (cr1-eqiad:9804 Transit: Lumen (442550281) {#3867} xe-3/3/2 gnmi eqiad)
2026-04-17 09:50:02 <wikibugs> ('PS1) ''Muehlenhoff: Netbox: Add eqsin02 to Ganeti sync [puppet] - ''https://gerrit.wikimedia.org/r/1273700 (https://phabricator.wikimedia.org/T421863)'
2026-04-17 09:50:03 <wikibugs> ('CR) ''Jcrespo: "I believe you were the ones to introduce these real ips, making sure you are ok with this change." [puppet] - ''https://gerrit.wikimedia.org/r/1273699 (https://phabricator.wikimedia.org/T422851) (owner: ''Jcrespo)'
2026-04-17 09:52:01 <icinga-wm> PROBLEM - Check unit status of httpbb_kubernetes_mw-web-next_hourly on cumin2002 is CRITICAL: CRITICAL: Status of the systemd unit httpbb_kubernetes_mw-web-next_hourly https://wikitech.wikimedia.org/wiki/Monitoring/systemd_unit_state
2026-04-17 09:53:51 <logmsgbot> !log marostegui@cumin1003 START - Cookbook sre.dns.admin DNS admin: pool esams [reason: no reason specified, no task ID specified]
2026-04-17 09:53:58 <logmsgbot> !log marostegui@cumin1003 END (PASS) - Cookbook sre.dns.admin (exit_code=0) DNS admin: pool esams [reason: no reason specified, no task ID specified]
2026-04-17 09:54:05 <marostegui> !log pool esams
2026-04-17 09:54:07 <stashbot> Logged the message at https://wikitech.wikimedia.org/wiki/Server_Admin_Log
2026-04-17 09:55:06 <logmsgbot> !log jynus@cumin1003 START - Cookbook sre.hosts.decommission for hosts ms-backup1001.eqiad.wmnet
2026-04-17 09:56:36 <wikibugs> ('CR) ''Ayounsi: [C:''+1] Netbox: Add eqsin02 to Ganeti sync [puppet] - ''https://gerrit.wikimedia.org/r/1273700 (https://phabricator.wikimedia.org/T421863) (owner: ''Muehlenhoff)'
2026-04-17 09:58:57 <wikibugs> ('CR) ''Muehlenhoff: [C:''+2] Netbox: Add eqsin02 to Ganeti sync [puppet] - ''https://gerrit.wikimedia.org/r/1273700 (https://phabricator.wikimedia.org/T421863) (owner: ''Muehlenhoff)'
2026-04-17 10:00:56 <logmsgbot> !log jynus@cumin1003 START - Cookbook sre.dns.netbox
2026-04-17 10:02:08 <wikibugs> 'ops-eqiad, ''SRE, ''DC-Ops, ''Data-Platform-SRE (2026-03-27 - 2026-04-17): Degraded RAID on an-worker1205 - https://phabricator.wikimedia.org/T422317#11832942 (''brouberol) @Jclark-ctr Feel free to replace the drive whenever convenient for you. Thank you!'
2026-04-17 10:02:19 <wikibugs> 'SRE, ''cloud-services-team, ''Infrastructure-Foundations, ''Toolforge: Adjust WMCS Gitlab CI/CD repo to stop using mirrors.wikimedia.org - https://phabricator.wikimedia.org/T423596#11832943 (''A_smart_kitten) (per T423596#11829501 & as the files seem potentially toolforge-related FWICS; feel free to reta...'
2026-04-17 10:03:19 <wikibugs> ('PS1) ''Jcrespo: backup: Remove old references to ms-backup1001 & ms-backup1002 [puppet] - ''https://gerrit.wikimedia.org/r/1273704 (https://phabricator.wikimedia.org/T422851)'
2026-04-17 10:03:44 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 1 day, 0:00:00 on db1156.eqiad.wmnet with reason: Maintenance
2026-04-17 10:03:53 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2 days, 0:00:00 on an-redacteddb1001.eqiad.wmnet,clouddb[1014,1018].eqiad.wmnet,db1155.eqiad.wmnet with reason: Maintenance
2026-04-17 10:03:55 <wikibugs> ('PS6) ''Jelto: gerrit: migrate gerrit_site away from root partition [puppet] - ''https://gerrit.wikimedia.org/r/1270774 (https://phabricator.wikimedia.org/T423027) (owner: ''Arnaudb)'
2026-04-17 10:04:01 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db1156 (T419961)', diff saved to https://phabricator.wikimedia.org/P91029 and previous config saved to /var/cache/conftool/dbconfig/20260417-100401-fceratto.json
2026-04-17 10:05:56 <wikibugs> ('CR) ''Jelto: [C:''-1] "@abran@wikimedia.org I rebased the change, maybe you can check if it also makes sense to you? -1 for now, should be merged after the migra" [puppet] - ''https://gerrit.wikimedia.org/r/1270774 (https://phabricator.wikimedia.org/T423027) (owner: ''Arnaudb)'
2026-04-17 10:06:39 <logmsgbot> jynus@cumin1003 decommission (PID 2051147) is awaiting input
2026-04-17 10:11:16 <jynus> thank you mr logmsgbot
2026-04-17 10:11:50 <logmsgbot> !log jynus@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.dns.netbox: ms-backup1001.eqiad.wmnet decommissioned, removing all IPs except the asset tag one - jynus@cumin1003"
2026-04-17 10:12:33 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1156 (T419961)', diff saved to https://phabricator.wikimedia.org/P91030 and previous config saved to /var/cache/conftool/dbconfig/20260417-101233-fceratto.json
2026-04-17 10:12:47 <jynus> there is a new ganeti_cluster: codfw_test for netbox
2026-04-17 10:12:58 <logmsgbot> !log jynus@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.dns.netbox: ms-backup1001.eqiad.wmnet decommissioned, removing all IPs except the asset tag one - jynus@cumin1003"
2026-04-17 10:12:58 <logmsgbot> !log jynus@cumin1003 END (PASS) - Cookbook sre.dns.netbox (exit_code=0)
2026-04-17 10:12:59 <logmsgbot> !log jynus@cumin1003 END (PASS) - Cookbook sre.hosts.decommission (exit_code=0) for hosts ms-backup1001.eqiad.wmnet
2026-04-17 10:13:56 <logmsgbot> !log jynus@cumin1003 START - Cookbook sre.hosts.decommission for hosts ms-backup1002.eqiad.wmnet
2026-04-17 10:14:25 <jinxer-wm> FIRING: SystemdUnitFailed: netbox_ganeti_eqsin02_sync.service on netbox1003:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 10:15:09 <wikibugs> 'SRE, ''Ganeti, ''Infrastructure-Foundations, ''Patch-For-Review: Migrating eqsin to routed Ganeti - https://phabricator.wikimedia.org/T421863#11832984 (''MoritzMuehlenhoff)'
2026-04-17 10:20:08 <logmsgbot> !log jynus@cumin1003 START - Cookbook sre.dns.netbox
2026-04-17 10:22:41 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1156', diff saved to https://phabricator.wikimedia.org/P91031 and previous config saved to /var/cache/conftool/dbconfig/20260417-102241-fceratto.json
2026-04-17 10:23:17 <wikibugs> ('PS2) ''Muehlenhoff: Remove bast1003 from list of bastions [puppet] - ''https://gerrit.wikimedia.org/r/1273413'
2026-04-17 10:25:47 <logmsgbot> jynus@cumin1003 decommission (PID 2069153) is awaiting input
2026-04-17 10:31:08 <logmsgbot> !log jynus@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.dns.netbox: ms-backup1002.eqiad.wmnet decommissioned, removing all IPs except the asset tag one - jynus@cumin1003"
2026-04-17 10:32:50 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1156', diff saved to https://phabricator.wikimedia.org/P91032 and previous config saved to /var/cache/conftool/dbconfig/20260417-103249-fceratto.json
2026-04-17 10:34:13 <logmsgbot> jynus@cumin1003 decommission (PID 2069153) is awaiting input
2026-04-17 10:36:13 <wikibugs> 'SRE-tools, ''bacula, ''Data-Persistence-Backup, ''Infrastructure-Foundations, and 2 others: netbox2003 backups (maybe others?) are missconfigured or failing to find the configured directory - https://phabricator.wikimedia.org/T423689 (''jcrespo) ''NEW'
2026-04-17 10:36:46 <wikibugs> 'SRE, ''SRE-swift-storage, ''SRE Observability: Thanos backends filling their root filesystems overnight - https://phabricator.wikimedia.org/T423690 (''MatthewVernon) ''NEW'
2026-04-17 10:36:51 <wikibugs> 'SRE, ''SRE-swift-storage, ''SRE Observability: Thanos backends filling their root filesystems overnight - https://phabricator.wikimedia.org/T423690#11833110 (''MatthewVernon) p:''Triage''High'
2026-04-17 10:36:53 <wikibugs> 'SRE-tools, ''bacula, ''Data-Persistence-Backup, ''Infrastructure-Foundations, and 2 others: netbox2003 backups (maybe others?) are missconfigured or failing to find the configured directory - https://phabricator.wikimedia.org/T423689#11833112 (''jcrespo) Let me know if this box or any other requires inve...'
2026-04-17 10:37:16 <logmsgbot> !log jynus@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.dns.netbox: ms-backup1002.eqiad.wmnet decommissioned, removing all IPs except the asset tag one - jynus@cumin1003"
2026-04-17 10:37:16 <logmsgbot> !log jynus@cumin1003 END (PASS) - Cookbook sre.dns.netbox (exit_code=0)
2026-04-17 10:37:17 <logmsgbot> !log jynus@cumin1003 END (PASS) - Cookbook sre.hosts.decommission (exit_code=0) for hosts ms-backup1002.eqiad.wmnet
2026-04-17 10:37:24 <wikibugs> ('CR) ''Clément Goubert: [C:''+1] backup: Ignore /srv/docker from srv-deployment backups, move cluster mgmt [puppet] - ''https://gerrit.wikimedia.org/r/1273676 (https://phabricator.wikimedia.org/T423619) (owner: ''Jcrespo)'
2026-04-17 10:37:48 <wikibugs> ('CR) ''Jcrespo: [C:''+2] backup: Remove old references to ms-backup1001 & ms-backup1002 [puppet] - ''https://gerrit.wikimedia.org/r/1273704 (https://phabricator.wikimedia.org/T422851) (owner: ''Jcrespo)'
2026-04-17 10:38:08 <wikibugs> ('PS2) ''Clément Goubert: gateway-check: Add matchers for liftwing and recommendation-api-ng [puppet] - ''https://gerrit.wikimedia.org/r/1271804 (https://phabricator.wikimedia.org/T422804)'
2026-04-17 10:38:56 <wikibugs> 'SRE-tools, ''bacula, ''Data-Persistence-Backup, ''Infrastructure-Foundations, and 2 others: netbox2003 backups (maybe others?) are missconfigured or failing to find the backup directory - https://phabricator.wikimedia.org/T423689#11833117 (''jcrespo)'
2026-04-17 10:40:45 <wikibugs> 'SRE, ''SRE-swift-storage, ''Ceph, ''ServiceOps new, and 2 others: scap can’t deploy (blob upload unknown) after apus.discovery.wmnet is repooled in codfw - https://phabricator.wikimedia.org/T422166#11833133 (''Blake) That makes a lot of sense; I've updated the docs with those edits, thanks! I've also lin...'
2026-04-17 10:41:48 <wikibugs> 'ops-eqiad, ''DC-Ops, ''decommission-hardware: decommission ms-backup1001 & ms-backup1002 - https://phabricator.wikimedia.org/T422851#11833134 (''jcrespo) a:''jcrespo''None'
2026-04-17 10:42:01 <wikibugs> 'ops-eqiad, ''DC-Ops, ''decommission-hardware: decommission ms-backup1001 & ms-backup1002 - https://phabricator.wikimedia.org/T422851#11833138 (''jcrespo) This is ready for dc ops.'
2026-04-17 10:42:27 <wikibugs> ('CR) ''Clément Goubert: [C:''+1] opensearch on k8s: Add semantic-search and ipoid to services proxy [puppet] - ''https://gerrit.wikimedia.org/r/1264739 (https://phabricator.wikimedia.org/T421293) (owner: ''Bking)'
2026-04-17 10:42:58 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1156 (T419961)', diff saved to https://phabricator.wikimedia.org/P91033 and previous config saved to /var/cache/conftool/dbconfig/20260417-104257-fceratto.json
2026-04-17 10:43:01 <wikibugs> ('CR) ''Clément Goubert: [C:''+1] Switch the base images to deb.debian.org [puppet] - ''https://gerrit.wikimedia.org/r/1273453 (https://phabricator.wikimedia.org/T423622) (owner: ''Muehlenhoff)'
2026-04-17 10:43:06 <logmsgbot> !log jynus@cumin1003 START - Cookbook sre.hosts.decommission for hosts ms-backup2001.codfw.wmnet
2026-04-17 10:43:19 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 1 day, 0:00:00 on db1162.eqiad.wmnet with reason: Maintenance
2026-04-17 10:43:28 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db1162 (T419961)', diff saved to https://phabricator.wikimedia.org/P91034 and previous config saved to /var/cache/conftool/dbconfig/20260417-104327-fceratto.json
2026-04-17 10:43:32 <wikibugs> ('CR) ''Clément Goubert: [C:''+1] opensearch on k8s: Activate semantic-search and ipoid in services proxy [puppet] - ''https://gerrit.wikimedia.org/r/1272909 (https://phabricator.wikimedia.org/T421293) (owner: ''Bking)'
2026-04-17 10:44:49 <wikibugs> ('PS2) ''Effie Mouzeli: mcrouter: update to 1.3.5 [deployment-charts] - ''https://gerrit.wikimedia.org/r/1272785 (https://phabricator.wikimedia.org/T421360)'
2026-04-17 10:44:59 <wikibugs> ('CR) ''Muehlenhoff: [C:''+2] Switch the base images to deb.debian.org [puppet] - ''https://gerrit.wikimedia.org/r/1273453 (https://phabricator.wikimedia.org/T423622) (owner: ''Muehlenhoff)'
2026-04-17 10:45:41 <icinga-wm> PROBLEM - Check if Pybal has been restarted after pybal.conf was changed on lvs2014 is CRITICAL: CRITICAL: Service pybal.service has not been restarted after /etc/pybal/pybal.conf was changed (gt 1h). https://wikitech.wikimedia.org/wiki/PyBal%23Pybal_service_has_not_been_restarted
2026-04-17 10:47:04 <wikibugs> 'SRE, ''Infrastructure-Foundations, ''Patch-For-Review, ''Release-Engineering-Team (Radar): New base images without mirrors.wikimedia.org - https://phabricator.wikimedia.org/T423622#11833147 (''MoritzMuehlenhoff) >>! In T423622#11830895, @thcipriani wrote: > Updated task description to clarify, yes, the S...'
2026-04-17 10:47:15 <wikibugs> 'SRE, ''Infrastructure-Foundations, ''Patch-For-Review, ''Release-Engineering-Team (Radar): New base images without mirrors.wikimedia.org - https://phabricator.wikimedia.org/T423622#11833149 (''MoritzMuehlenhoff) p:''Triage''High'
2026-04-17 10:48:36 <logmsgbot> !log jynus@cumin1003 START - Cookbook sre.dns.netbox
2026-04-17 10:50:21 <icinga-wm> PROBLEM - Check if Pybal has been restarted after pybal.conf was changed on lvs1019 is CRITICAL: CRITICAL: Service pybal.service has not been restarted after /etc/pybal/pybal.conf was changed (gt 1h). https://wikitech.wikimedia.org/wiki/PyBal%23Pybal_service_has_not_been_restarted
2026-04-17 10:50:21 <icinga-wm> PROBLEM - Check if Pybal has been restarted after pybal.conf was changed on lvs2013 is CRITICAL: CRITICAL: Service pybal.service has not been restarted after /etc/pybal/pybal.conf was changed (gt 1h). https://wikitech.wikimedia.org/wiki/PyBal%23Pybal_service_has_not_been_restarted
2026-04-17 10:51:18 <wikibugs> ('PS1) ''Jcrespo: bacula: Reenable copy jobs to the offsite pool [puppet] - ''https://gerrit.wikimedia.org/r/1273738 (https://phabricator.wikimedia.org/T313582)'
2026-04-17 10:51:31 <wikibugs> ('PS2) ''Jcrespo: bacula: Reenable copy jobs to the offsite pool [puppet] - ''https://gerrit.wikimedia.org/r/1273738 (https://phabricator.wikimedia.org/T313582)'
2026-04-17 10:52:01 <icinga-wm> RECOVERY - Check unit status of httpbb_kubernetes_mw-web-next_hourly on cumin2002 is OK: OK: Status of the systemd unit httpbb_kubernetes_mw-web-next_hourly https://wikitech.wikimedia.org/wiki/Monitoring/systemd_unit_state
2026-04-17 10:52:27 <wikibugs> ('CR) ''Jcrespo: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273738 (https://phabricator.wikimedia.org/T313582) (owner: ''Jcrespo)'
2026-04-17 10:52:35 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1162 (T419961)', diff saved to https://phabricator.wikimedia.org/P91035 and previous config saved to /var/cache/conftool/dbconfig/20260417-105234-fceratto.json
2026-04-17 10:53:28 <logmsgbot> !log jynus@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.dns.netbox: ms-backup2001.codfw.wmnet decommissioned, removing all IPs except the asset tag one - jynus@cumin1003"
2026-04-17 10:54:42 <logmsgbot> !log jynus@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.dns.netbox: ms-backup2001.codfw.wmnet decommissioned, removing all IPs except the asset tag one - jynus@cumin1003"
2026-04-17 10:54:42 <logmsgbot> !log jynus@cumin1003 END (PASS) - Cookbook sre.dns.netbox (exit_code=0)
2026-04-17 10:54:42 <wikibugs> ('PS1) ''Effie Mouzeli: (WIP) update mcrouter module to 1.3.5 [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273739'
2026-04-17 10:54:43 <logmsgbot> !log jynus@cumin1003 END (PASS) - Cookbook sre.hosts.decommission (exit_code=0) for hosts ms-backup2001.codfw.wmnet
2026-04-17 10:55:21 <logmsgbot> !log jynus@cumin1003 START - Cookbook sre.hosts.decommission for hosts ms-backup2002.codfw.wmnet
2026-04-17 10:55:40 <icinga-wm> PROBLEM - Check if Pybal has been restarted after pybal.conf was changed on lvs1020 is CRITICAL: CRITICAL: Service pybal.service has not been restarted after /etc/pybal/pybal.conf was changed (gt 1h). https://wikitech.wikimedia.org/wiki/PyBal%23Pybal_service_has_not_been_restarted
2026-04-17 10:57:04 <wikibugs> ('PS3) ''Jcrespo: bacula: Reenable copy jobs to the offsite pool [puppet] - ''https://gerrit.wikimedia.org/r/1273738 (https://phabricator.wikimedia.org/T313582)'
2026-04-17 10:57:10 <wikibugs> ('CR) ''Jcrespo: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273738 (https://phabricator.wikimedia.org/T313582) (owner: ''Jcrespo)'
2026-04-17 11:00:05 <jouncebot> Deploy window No deploys all day! See Deployments/Emergencies if things are broken. (https://wikitech.wikimedia.org/wiki/Deployments#deploycal-item-20260417T0700)
2026-04-17 11:00:05 <jouncebot> jelto, arnoldokoth, mutante, and arnaudb: May I have your attention please! GitLab version upgrades. (https://wikitech.wikimedia.org/wiki/Deployments#deploycal-item-20260417T1100)
2026-04-17 11:02:05 <wikibugs> ('CR) ''Jcrespo: [C:''+2] bacula: Reenable copy jobs to the offsite pool [puppet] - ''https://gerrit.wikimedia.org/r/1273738 (https://phabricator.wikimedia.org/T313582) (owner: ''Jcrespo)'
2026-04-17 11:02:43 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1162', diff saved to https://phabricator.wikimedia.org/P91036 and previous config saved to /var/cache/conftool/dbconfig/20260417-110242-fceratto.json
2026-04-17 11:03:00 <logmsgbot> !log jynus@cumin1003 START - Cookbook sre.dns.netbox
2026-04-17 11:08:18 <logmsgbot> !log jynus@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.dns.netbox: ms-backup2002.codfw.wmnet decommissioned, removing all IPs except the asset tag one - jynus@cumin1003"
2026-04-17 11:11:24 <logmsgbot> jynus@cumin1003 decommission (PID 2112382) is awaiting input
2026-04-17 11:11:31 <logmsgbot> !log jynus@cumin1003 END (PASS) - Cookbook sre.dns.netbox (exit_code=0)
2026-04-17 11:11:31 <logmsgbot> !log jynus@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.dns.netbox: ms-backup2002.codfw.wmnet decommissioned, removing all IPs except the asset tag one - jynus@cumin1003"
2026-04-17 11:11:32 <logmsgbot> !log jynus@cumin1003 END (PASS) - Cookbook sre.hosts.decommission (exit_code=0) for hosts ms-backup2002.codfw.wmnet
2026-04-17 11:12:05 <wikibugs> ('PS1) ''Jcrespo: backup: Fix wrong storage config for offsite [puppet] - ''https://gerrit.wikimedia.org/r/1273740 (https://phabricator.wikimedia.org/T313582)'
2026-04-17 11:12:32 <wikibugs> ('PS2) ''Jcrespo: backup: Fix wrong storage config for offsite [puppet] - ''https://gerrit.wikimedia.org/r/1273740 (https://phabricator.wikimedia.org/T313582)'
2026-04-17 11:12:51 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1162', diff saved to https://phabricator.wikimedia.org/P91037 and previous config saved to /var/cache/conftool/dbconfig/20260417-111250-fceratto.json
2026-04-17 11:14:38 <wikibugs> 'SRE, ''Infrastructure-Foundations: Integrate Trixie 13.3 point update - https://phabricator.wikimedia.org/T414179#11833215 (''MoritzMuehlenhoff)'
2026-04-17 11:15:27 <wikibugs> ('CR) ''Jcrespo: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273740 (https://phabricator.wikimedia.org/T313582) (owner: ''Jcrespo)'
2026-04-17 11:15:52 <icinga-wm> PROBLEM - Backup freshness on backup1014 is CRITICAL: Stale: 1 (backup1013), Fresh: 138 jobs https://wikitech.wikimedia.org/wiki/Bacula%23Monitoring
2026-04-17 11:17:40 <wikibugs> ('CR) ''Jcrespo: [C:''+2] backup: Fix wrong storage config for offsite [puppet] - ''https://gerrit.wikimedia.org/r/1273740 (https://phabricator.wikimedia.org/T313582) (owner: ''Jcrespo)'
2026-04-17 11:19:35 <wikibugs> ('PS1) ''Muehlenhoff: sre.ganeti.makevm: Bump memory requirements for VMs to 2G [cookbooks] - ''https://gerrit.wikimedia.org/r/1273743 (https://phabricator.wikimedia.org/T422596)'
2026-04-17 11:23:04 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1162 (T419961)', diff saved to Unable to send diff to phaste and previous config saved to /var/cache/conftool/dbconfig/20260417-112259-fceratto.json
2026-04-17 11:23:25 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 1 day, 0:00:00 on db1182.eqiad.wmnet with reason: Maintenance
2026-04-17 11:23:34 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db1182 (T419961)', diff saved to https://phabricator.wikimedia.org/P91039 and previous config saved to /var/cache/conftool/dbconfig/20260417-112333-fceratto.json
2026-04-17 11:25:10 <wikibugs> ('PS1) ''Ayounsi: eqsin routed ganeti: use private IPs instead of loopbacks [puppet] - ''https://gerrit.wikimedia.org/r/1273744 (https://phabricator.wikimedia.org/T421863)'
2026-04-17 11:25:59 <jinxer-wm> FIRING: KubernetesDeploymentUnavailableReplicas: ...
2026-04-17 11:25:59 <jinxer-wm> Deployment linkrecommendation-internal in linkrecommendation at eqiad has persistently unavailable replicas - https://wikitech.wikimedia.org/wiki/Kubernetes/Troubleshooting#Troubleshooting_a_deployment - https://grafana.wikimedia.org/d/a260da06-259a-4ee4-9540-5cab01a246c8/kubernetes-deployment-details?var-site=eqiad&var-cluster=k8s&var-namespace=linkrecommendation&var-deployment=linkrecommendation-internal - ...
2026-04-17 11:25:59 <jinxer-wm> https://alerts.wikimedia.org/?q=alertname%3DKubernetesDeploymentUnavailableReplicas
2026-04-17 11:30:56 <icinga-wm> RECOVERY - MariaDB Replica Lag: s8 on dbstore1009 is OK: OK slave_sql_lag Replication lag: 0.36 seconds https://wikitech.wikimedia.org/wiki/MariaDB/troubleshooting%23Depooling_a_replica
2026-04-17 11:31:49 <wikibugs> 'ops-eqiad, ''SRE, ''DC-Ops, ''decommission-hardware: decommission ms-backup1001 & ms-backup1002 - https://phabricator.wikimedia.org/T422851#11833242 (''Jclark-ctr) a:''Jclark-ctr'
2026-04-17 11:32:01 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1182 (T419961)', diff saved to https://phabricator.wikimedia.org/P91040 and previous config saved to /var/cache/conftool/dbconfig/20260417-113201-fceratto.json
2026-04-17 11:32:25 <wikibugs> ('CR) ''Muehlenhoff: [C:''+1] "Looks good" [puppet] - ''https://gerrit.wikimedia.org/r/1273744 (https://phabricator.wikimedia.org/T421863) (owner: ''Ayounsi)'
2026-04-17 11:32:48 <wikibugs> 'ops-eqiad, ''SRE, ''cloud-services-team, ''Data-Services, and 3 others: decommission clouddb1019.eqiad.wmnet - https://phabricator.wikimedia.org/T423151#11833255 (''Jclark-ctr)'
2026-04-17 11:32:50 <wikibugs> 'ops-eqiad, ''SRE, ''cloud-services-team, ''Data-Services, and 3 others: decommission clouddb1019.eqiad.wmnet - https://phabricator.wikimedia.org/T423151#11833256 (''Jclark-ctr) ''Open''Resolved'
2026-04-17 11:34:58 <wikibugs> ('CR) ''Ayounsi: [C:''+2] eqsin routed ganeti: use private IPs instead of loopbacks [puppet] - ''https://gerrit.wikimedia.org/r/1273744 (https://phabricator.wikimedia.org/T421863) (owner: ''Ayounsi)'
2026-04-17 11:35:30 <icinga-wm> PROBLEM - Host ganeti1031 is DOWN: PING CRITICAL - Packet loss = 100%
2026-04-17 11:35:32 <icinga-wm> PROBLEM - Host netboxdb1003 is DOWN: PING CRITICAL - Packet loss = 100%
2026-04-17 11:35:34 <icinga-wm> PROBLEM - Host logstash1023 is DOWN: PING CRITICAL - Packet loss = 100%
2026-04-17 11:36:04 <icinga-wm> PROBLEM - Host apt1002 is DOWN: PING CRITICAL - Packet loss = 100%
2026-04-17 11:37:00 <icinga-wm> RECOVERY - Host ganeti1031 is UP: PING OK - Packet loss = 0%, RTA = 0.29 ms
2026-04-17 11:37:30 <wikibugs> ('PS1) ''Jcrespo: mediabackup: Remove last references to ms-backup2001 & ms-backup2002 [puppet] - ''https://gerrit.wikimedia.org/r/1273745 (https://phabricator.wikimedia.org/T422852)'
2026-04-17 11:38:07 <jinxer-wm> FIRING: [5x] ProbeDown: Service aqs1010-a:7000 has failed probes (tcp_cassandra_a_ssl_ip4) - https://grafana.wikimedia.org/d/O0nHhdhnz/network-probes-overview?var-job=probes/custom&var-module=All - https://alerts.wikimedia.org/?q=alertname%3DProbeDown
2026-04-17 11:38:33 <wikibugs> ('CR) ''Ayounsi: [C:''+1] sre.ganeti.makevm: Bump memory requirements for VMs to 2G [cookbooks] - ''https://gerrit.wikimedia.org/r/1273743 (https://phabricator.wikimedia.org/T422596) (owner: ''Muehlenhoff)'
2026-04-17 11:38:37 <wikibugs> ('CR) ''Jcrespo: [C:''+2] mediabackup: Remove last references to ms-backup2001 & ms-backup2002 [puppet] - ''https://gerrit.wikimedia.org/r/1273745 (https://phabricator.wikimedia.org/T422852) (owner: ''Jcrespo)'
2026-04-17 11:39:14 <wikibugs> 'SRE, ''Ganeti, ''Infrastructure-Foundations, ''Patch-For-Review: Migrating eqsin to routed Ganeti - https://phabricator.wikimedia.org/T421863#11833265 (''ayounsi)'
2026-04-17 11:39:17 <jinxer-wm> FIRING: [2x] JobUnavailable: Reduced availability for job netbox_global in ops@codfw - https://wikitech.wikimedia.org/wiki/Prometheus#Prometheus_job_unavailable - https://grafana.wikimedia.org/d/NEJu05xZz/prometheus-targets - https://alerts.wikimedia.org/?q=alertname%3DJobUnavailable
2026-04-17 11:40:32 <icinga-wm> RECOVERY - Host apt1002 is UP: PING OK - Packet loss = 0%, RTA = 0.59 ms
2026-04-17 11:40:34 <wikibugs> 'ops-codfw, ''DC-Ops, ''decommission-hardware: decommission ms-backup2001 & ms-backup2002 - https://phabricator.wikimedia.org/T422852#11833266 (''jcrespo) a:''jcrespo''None'
2026-04-17 11:40:36 <icinga-wm> RECOVERY - Host logstash1023 is UP: PING OK - Packet loss = 0%, RTA = 0.34 ms
2026-04-17 11:40:36 <icinga-wm> RECOVERY - Host netboxdb1003 is UP: PING WARNING - Packet loss = 50%, RTA = 0.84 ms
2026-04-17 11:40:47 <wikibugs> 'ops-codfw, ''DC-Ops, ''decommission-hardware: decommission ms-backup2001 & ms-backup2002 - https://phabricator.wikimedia.org/T422852#11833270 (''jcrespo) This is ready for dc ops.'
2026-04-17 11:41:53 <wikibugs> ('CR) ''Klausman: [C:''+1] "Just one clarification question, LGTM." [deployment-charts] - ''https://gerrit.wikimedia.org/r/1271709 (owner: ''Dpogorzelski)'
2026-04-17 11:42:10 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1182', diff saved to https://phabricator.wikimedia.org/P91041 and previous config saved to /var/cache/conftool/dbconfig/20260417-114210-fceratto.json
2026-04-17 11:42:20 <wikibugs> ('CR) ''Klausman: [C:''+1] kserve-resources: fix securityContext propagation [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273664 (https://phabricator.wikimedia.org/T423149) (owner: ''Dpogorzelski)'
2026-04-17 11:43:07 <jinxer-wm> FIRING: [5x] ProbeDown: Service aqs1010-a:7000 has failed probes (tcp_cassandra_a_ssl_ip4) - https://grafana.wikimedia.org/d/O0nHhdhnz/network-probes-overview?var-job=probes/custom&var-module=All - https://alerts.wikimedia.org/?q=alertname%3DProbeDown
2026-04-17 11:44:17 <jinxer-wm> RESOLVED: [2x] JobUnavailable: Reduced availability for job netbox_global in ops@codfw - https://wikitech.wikimedia.org/wiki/Prometheus#Prometheus_job_unavailable - https://grafana.wikimedia.org/d/NEJu05xZz/prometheus-targets - https://alerts.wikimedia.org/?q=alertname%3DJobUnavailable
2026-04-17 11:44:25 <jinxer-wm> FIRING: [7x] SystemdUnitFailed: netbox_ganeti_codfw_sync.service on netbox1003:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 11:45:44 <XioNoX> moritzm: any idea why ganeti1031 rebooted? :) ganeti1031:~$ uptime -> 11:45:17 up 8 min, 2 users, load average: 5.94, 4.17, 1.94
2026-04-17 11:45:55 <XioNoX> it briefly took down Netbox's DB
2026-04-17 11:47:08 <wikibugs> 'ops-eqiad, ''SRE, ''DC-Ops, ''decommission-hardware: decommission ms-backup1001 & ms-backup1002 - https://phabricator.wikimedia.org/T422851#11833279 (''Jclark-ctr)'
2026-04-17 11:47:11 <wikibugs> 'ops-eqiad, ''SRE, ''DC-Ops, ''decommission-hardware: decommission ms-backup1001 & ms-backup1002 - https://phabricator.wikimedia.org/T422851#11833280 (''Jclark-ctr) ''Open''Resolved'
2026-04-17 11:47:51 <moritzm> possibly some hardware issue, can you connect to the mgmt? it stalls for me
2026-04-17 11:48:06 <XioNoX> moritzm: I can ssh fine to the host
2026-04-17 11:48:17 <moritzm> the host, yes, but also the mgmt?
2026-04-17 11:48:24 <XioNoX> dunno, haven't tried :)
2026-04-17 11:48:37 <moritzm> can you check? otherwise I'll make a dc ops task
2026-04-17 11:49:21 <moritzm> the server is quite old, it'll be refreshed sometime next FY
2026-04-17 11:49:25 <jinxer-wm> FIRING: [8x] SystemdUnitFailed: check_netbox_uncommitted_dns_changes.service on netbox1003:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 11:49:39 <XioNoX> moritzm: the server's mgmt doesn't reply to pings
2026-04-17 11:49:44 <XioNoX> something is fried
2026-04-17 11:50:00 <wikibugs> ('CR) ''Muehlenhoff: [C:''+2] sre.ganeti.makevm: Bump memory requirements for VMs to 2G [cookbooks] - ''https://gerrit.wikimedia.org/r/1273743 (https://phabricator.wikimedia.org/T422596) (owner: ''Muehlenhoff)'
2026-04-17 11:50:21 <moritzm> k, I'll open a DC ops task for this so that they can check it Monday
2026-04-17 11:52:19 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1182', diff saved to https://phabricator.wikimedia.org/P91042 and previous config saved to /var/cache/conftool/dbconfig/20260417-115218-fceratto.json
2026-04-17 11:53:00 <logmsgbot> !log jiji@deploy1003 helmfile [eqiad] START helmfile.d/services/mw-parsoid: apply
2026-04-17 11:53:27 <logmsgbot> !log jiji@deploy1003 helmfile [eqiad] DONE helmfile.d/services/mw-parsoid: apply
2026-04-17 11:54:25 <jinxer-wm> FIRING: [8x] SystemdUnitFailed: check_netbox_uncommitted_dns_changes.service on netbox1003:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 11:54:51 <logmsgbot> !log jiji@deploy1003 helmfile [eqiad] START helmfile.d/services/mw-parsoid: apply
2026-04-17 11:55:19 <logmsgbot> !log jiji@deploy1003 helmfile [eqiad] DONE helmfile.d/services/mw-parsoid: apply
2026-04-17 11:56:28 <wikibugs> 'ops-eqiad, ''DC-Ops: Unreachable mgmt on ganeti1031 - https://phabricator.wikimedia.org/T423697 (''MoritzMuehlenhoff) ''NEW'
2026-04-17 11:58:47 <wikibugs> ('CR) ''Elukey: [C:''+1] "\o/" [deployment-charts] - ''https://gerrit.wikimedia.org/r/1272785 (https://phabricator.wikimedia.org/T421360) (owner: ''Effie Mouzeli)'
2026-04-17 11:59:25 <jinxer-wm> FIRING: [8x] SystemdUnitFailed: check_netbox_uncommitted_dns_changes.service on netbox1003:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 12:02:17 <wikibugs> 'ops-eqiad, ''DC-Ops: Unreachable mgmt on ganeti1031 - https://phabricator.wikimedia.org/T423697#11833311 (''Jclark-ctr) ''Open''Resolved a:''Jclark-ctr Replaced power cable. The latch tab on the RJ45 end of the management cable was broken, and the cable had fallen out.'
2026-04-17 12:02:27 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1182 (T419961)', diff saved to https://phabricator.wikimedia.org/P91043 and previous config saved to /var/cache/conftool/dbconfig/20260417-120226-fceratto.json
2026-04-17 12:02:48 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 1 day, 0:00:00 on db1188.eqiad.wmnet with reason: Maintenance
2026-04-17 12:02:56 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db1188 (T419961)', diff saved to https://phabricator.wikimedia.org/P91044 and previous config saved to /var/cache/conftool/dbconfig/20260417-120255-fceratto.json
2026-04-17 12:06:29 <wikibugs> ('CR) ''Elukey: [C:''+1] "Really nice! I think it is worth to add a comment about the kubernetes min version to the README for future references." [deployment-charts] - ''https://gerrit.wikimedia.org/r/1271709 (owner: ''Dpogorzelski)'
2026-04-17 12:06:46 <wikibugs> ('PS1) ''Tiziano Fogli: thanos/compact: avoid constant Puppet changes [puppet] - ''https://gerrit.wikimedia.org/r/1273762 (https://phabricator.wikimedia.org/T386911)'
2026-04-17 12:09:25 <jinxer-wm> FIRING: [7x] SystemdUnitFailed: netbox_ganeti_codfw_sync.service on netbox1003:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 12:10:56 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1188 (T419961)', diff saved to https://phabricator.wikimedia.org/P91045 and previous config saved to /var/cache/conftool/dbconfig/20260417-121056-fceratto.json
2026-04-17 12:12:00 <wikibugs> ('CR) ''Tiziano Fogli: [C:''+1] puppet: remove pyrra modules/profiles [puppet] - ''https://gerrit.wikimedia.org/r/1270996 (https://phabricator.wikimedia.org/T423307) (owner: ''Herron)'
2026-04-17 12:12:11 <wikibugs> ('CR) ''Tiziano Fogli: [C:''+1] pyrra: remove pyrra/slo/slos dns entries [dns] - ''https://gerrit.wikimedia.org/r/1270995 (https://phabricator.wikimedia.org/T423307) (owner: ''Herron)'
2026-04-17 12:12:23 <wikibugs> ('CR) ''Tiziano Fogli: [C:''+1] pyrra: remove configuration for web interface [puppet] - ''https://gerrit.wikimedia.org/r/1270992 (https://phabricator.wikimedia.org/T423307) (owner: ''Herron)'
2026-04-17 12:12:35 <wikibugs> ('CR) ''Tiziano Fogli: [C:''+1] pyrra: ensure absent on package and services [puppet] - ''https://gerrit.wikimedia.org/r/1270974 (https://phabricator.wikimedia.org/T423307) (owner: ''Herron)'
2026-04-17 12:13:44 <wikibugs> ('CR) ''Tiziano Fogli: [C:''+1] Avoid false positive alerts after Ganeti master failover [puppet] - ''https://gerrit.wikimedia.org/r/1272701 (owner: ''Muehlenhoff)'
2026-04-17 12:14:25 <jinxer-wm> RESOLVED: [3x] SystemdUnitFailed: netbox_ganeti_eqsin02_sync.service on netbox1003:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 12:16:09 <wikibugs> 'SRE-tools, ''Infrastructure-Foundations, ''Data-Platform-SRE (2026-03-27 - 2026-04-17): debmonitor-client crashes for growthbook image - https://phabricator.wikimedia.org/T423413#11833335 (''elukey) I already had the docker-report repo checked out in my home dir on build2002, so I pulled your changes and r...'
2026-04-17 12:17:13 <wikibugs> ('CR) ''A smart kitten: Enwikinews: disable lingering FlaggedRevs template processing (''1 comment) [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1271839 (https://phabricator.wikimedia.org/T423512) (owner: ''Pppery)'
2026-04-17 12:21:04 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1188', diff saved to https://phabricator.wikimedia.org/P91046 and previous config saved to /var/cache/conftool/dbconfig/20260417-122104-fceratto.json
2026-04-17 12:25:31 <wikibugs> ('CR) ''Tiziano Fogli: "The metric mediawiki_http_requests_duration_bucket comes from the ops instance. Ideally, if possible, the best place for a recording rule " [puppet] - ''https://gerrit.wikimedia.org/r/1270480 (https://phabricator.wikimedia.org/T249663) (owner: ''Hnowlan)'
2026-04-17 12:25:56 <wikibugs> 'SRE-tools, ''Infrastructure-Foundations, ''Data-Platform-SRE (2026-03-27 - 2026-04-17): debmonitor-client crashes for growthbook image - https://phabricator.wikimedia.org/T423413#11833361 (''elukey) The docker-report run now works, but it happened the same also tonight EU time (no growthbook error reported...'
2026-04-17 12:26:43 <wikibugs> 'ops-eqiad, ''SRE, ''DC-Ops: Unresponsive management for clouddb1019.mgmt:22 - https://phabricator.wikimedia.org/T423387#11833362 (''Jclark-ctr) ''Open''Resolved'
2026-04-17 12:29:04 <icinga-wm> PROBLEM - MariaDB Replica Lag: m1 on db2160 is CRITICAL: CRITICAL slave_sql_lag Replication lag: 617.46 seconds https://wikitech.wikimedia.org/wiki/MariaDB/troubleshooting%23Depooling_a_replica
2026-04-17 12:31:12 <marostegui> jynus: ^ a big delete happened in bacula or something? looks like it on the replica, nothing important, but just checking
2026-04-17 12:31:12 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1188', diff saved to https://phabricator.wikimedia.org/P91047 and previous config saved to /var/cache/conftool/dbconfig/20260417-123111-fceratto.json
2026-04-17 12:31:16 <wikibugs> ('CR) ''Kamila Součková: "recheck" [deployment-charts] - ''https://gerrit.wikimedia.org/r/1201804 (https://phabricator.wikimedia.org/T388969) (owner: ''Kamila Součková)'
2026-04-17 12:32:05 <jynus> marostegui: yeah, I was doing some cleanup
2026-04-17 12:32:11 <marostegui> jynus: cool, thanks! noted
2026-04-17 12:32:12 <jynus> but didn't expect it was so large
2026-04-17 12:32:16 <marostegui> nah no issue
2026-04-17 12:32:26 <marostegui> it won't p4ge or anything like that
2026-04-17 12:33:01 <jynus> I think there was some corruption due to old records being stale
2026-04-17 12:33:04 <jynus> and I am fixing that
2026-04-17 12:33:45 <jynus> let me know if it goes too bad
2026-04-17 12:36:04 <icinga-wm> RECOVERY - MariaDB Replica Lag: m1 on db2160 is OK: OK slave_sql_lag Replication lag: 0.27 seconds https://wikitech.wikimedia.org/wiki/MariaDB/troubleshooting%23Depooling_a_replica
2026-04-17 12:36:53 <marostegui> jynus: ^ wohoo
2026-04-17 12:36:59 <wikibugs> ('PS1) ''Effie Mouzeli: mw-parsoid: bump php-fpm worker number [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273766'
2026-04-17 12:37:46 <wikibugs> ('CR) ''Jgiannelos: [C:''+1] mw-parsoid: bump php-fpm worker number [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273766 (owner: ''Effie Mouzeli)'
2026-04-17 12:38:19 <wikibugs> ('CR) ''Effie Mouzeli: [C:''+2] mw-parsoid: bump php-fpm worker number [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273766 (owner: ''Effie Mouzeli)'
2026-04-17 12:40:28 <wikibugs> ('Merged) ''jenkins-bot: mw-parsoid: bump php-fpm worker number [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273766 (owner: ''Effie Mouzeli)'
2026-04-17 12:41:15 <logmsgbot> !log jiji@deploy1003 helmfile [eqiad] START helmfile.d/services/mw-parsoid: apply
2026-04-17 12:41:21 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1188 (T419961)', diff saved to https://phabricator.wikimedia.org/P91048 and previous config saved to /var/cache/conftool/dbconfig/20260417-124120-fceratto.json
2026-04-17 12:41:41 <logmsgbot> !log jiji@deploy1003 helmfile [eqiad] DONE helmfile.d/services/mw-parsoid: apply
2026-04-17 12:41:42 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 1 day, 0:00:00 on db1197.eqiad.wmnet with reason: Maintenance
2026-04-17 12:41:50 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db1197 (T419961)', diff saved to https://phabricator.wikimedia.org/P91049 and previous config saved to /var/cache/conftool/dbconfig/20260417-124149-fceratto.json
2026-04-17 12:43:07 <jinxer-wm> FIRING: [4x] ProbeDown: Service aqs1010-a:7000 has failed probes (tcp_cassandra_a_ssl_ip4) - https://grafana.wikimedia.org/d/O0nHhdhnz/network-probes-overview?var-job=probes/custom&var-module=All - https://alerts.wikimedia.org/?q=alertname%3DProbeDown
2026-04-17 12:45:32 <wikibugs> ('PS2) ''Ottomata: flink-app - default to setting metrics.internal.query-service.port [deployment-charts] - ''https://gerrit.wikimedia.org/r/1268071 (https://phabricator.wikimedia.org/T421216)'
2026-04-17 12:45:47 <wikibugs> ('CR) ''Ottomata: flink-app - default to setting metrics.internal.query-service.port (''2 comments) [deployment-charts] - ''https://gerrit.wikimedia.org/r/1268071 (https://phabricator.wikimedia.org/T421216) (owner: ''Ottomata)'
2026-04-17 12:46:45 <wikibugs> ('PS4) ''Arnaudb: gerrit: update sync-instances cookbook [cookbooks] - ''https://gerrit.wikimedia.org/r/1270863 (https://phabricator.wikimedia.org/T333143)'
2026-04-17 12:47:45 <jinxer-wm> FIRING: WidespreadPuppetFailure: Puppet has failed in drmrs - https://puppetboard.wikimedia.org/nodes?status=failed - https://grafana.wikimedia.org/d/yOxVDGvWk/puppet?orgId=1&viewPanel=6 - https://alerts.wikimedia.org/?q=alertname%3DWidespreadPuppetFailure
2026-04-17 12:50:10 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1197 (T419961)', diff saved to https://phabricator.wikimedia.org/P91050 and previous config saved to /var/cache/conftool/dbconfig/20260417-125009-fceratto.json
2026-04-17 12:50:55 <wikibugs> ('PS3) ''A smart kitten: enwikinews: Move override for $wgFlaggedRevsHandleIncludes to InitialiseSettings.php [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1273763 (https://phabricator.wikimedia.org/T423512)'
2026-04-17 12:51:38 <wikibugs> ('CR) ''Lucas Werkmeister (WMDE): [C:''+1] enwikinews: Move override for $wgFlaggedRevsHandleIncludes to InitialiseSettings.php [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1273763 (https://phabricator.wikimedia.org/T423512) (owner: ''A smart kitten)'
2026-04-17 12:51:58 <wikibugs> ('CR) ''A smart kitten: "Thanks again for your investigations @lucas.werkmeister@wikimedia.de :)" [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1273763 (https://phabricator.wikimedia.org/T423512) (owner: ''A smart kitten)'
2026-04-17 12:52:43 <wikibugs> ('PS1) ''Marostegui: mariadb: Productionize clouddb1032 [puppet] - ''https://gerrit.wikimedia.org/r/1273769 (https://phabricator.wikimedia.org/T409557)'
2026-04-17 12:52:49 <marostegui> dhinus: ^
2026-04-17 12:53:11 <wikibugs> ('CR) ''Marostegui: "Initial patch to be able to start the cloning" [puppet] - ''https://gerrit.wikimedia.org/r/1273769 (https://phabricator.wikimedia.org/T409557) (owner: ''Marostegui)'
2026-04-17 12:53:21 <wikibugs> ('CR) ''A smart kitten: Enwikinews: disable lingering FlaggedRevs template processing (''1 comment) [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1271839 (https://phabricator.wikimedia.org/T423512) (owner: ''Pppery)'
2026-04-17 12:53:37 <wikibugs> ('PS3) ''Dpogorzelski: knative-serving: update chart to 1.21.1 [deployment-charts] - ''https://gerrit.wikimedia.org/r/1271709'
2026-04-17 12:54:22 <wikibugs> ('CR) ''Dpogorzelski: knative-serving: update chart to 1.21.1 (''1 comment) [deployment-charts] - ''https://gerrit.wikimedia.org/r/1271709 (owner: ''Dpogorzelski)'
2026-04-17 12:54:54 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 12:00:00 on db2150.codfw.wmnet with reason: Maintenance
2026-04-17 12:55:02 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db2150 (T419635)', diff saved to https://phabricator.wikimedia.org/P91051 and previous config saved to /var/cache/conftool/dbconfig/20260417-125501-fceratto.json
2026-04-17 12:55:06 <stashbot> T419635: Drop il_to column from imagelinks table in wmf production - https://phabricator.wikimedia.org/T419635
2026-04-17 12:55:22 <dhinus> marostegui: wait, clouddb1032 has not arrived yet, has it?
2026-04-17 12:55:49 <marostegui> dhinus: you are right, I have no idea why I did 32 instead of 24
2026-04-17 12:55:51 <marostegui> let me ammend
2026-04-17 12:55:56 <dhinus> ah ok :D
2026-04-17 12:56:36 <dhinus> btw when is the x4 split going to happen in prod?
2026-04-17 12:56:48 <marostegui> dhinus: I am not sure yet
2026-04-17 12:56:49 <marostegui> Amir1: ^
2026-04-17 12:57:14 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2150 (T419635)', diff saved to https://phabricator.wikimedia.org/P91052 and previous config saved to /var/cache/conftool/dbconfig/20260417-125714-fceratto.json
2026-04-17 12:57:21 <dhinus> let's move to -data-persistence :)
2026-04-17 12:58:21 <wikibugs> ('CR) ''Kamila Součková: "@jmeybohm@wikimedia.org it passed! I even ran it a 2nd time because I couldn't believe it!" [deployment-charts] - ''https://gerrit.wikimedia.org/r/1201804 (https://phabricator.wikimedia.org/T388969) (owner: ''Kamila Součková)'
2026-04-17 12:58:51 <wikibugs> 'SRE-tools, ''Infrastructure-Foundations, ''Data-Platform-SRE (2026-03-27 - 2026-04-17): debmonitor-client crashes for growthbook image - https://phabricator.wikimedia.org/T423413#11833429 (''brouberol) I had modified the script on disk with `PYTHONPATH=''` to run the whole command, to ensure our change wou...'
2026-04-17 12:59:17 <wikibugs> 'SRE-tools, ''Infrastructure-Foundations, ''Data-Platform-SRE (2026-03-27 - 2026-04-17): debmonitor-client crashes for growthbook image - https://phabricator.wikimedia.org/T423413#11833432 (''brouberol) Thank you @elukey for your assistance in the review, build and release process! I think we can now close...'
2026-04-17 13:00:18 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1197', diff saved to https://phabricator.wikimedia.org/P91053 and previous config saved to /var/cache/conftool/dbconfig/20260417-130018-fceratto.json
2026-04-17 13:00:37 <logmsgbot> !log jiji@cumin1003 START - Cookbook sre.ganeti.reboot-vm for VM wikikube-worker-exp1001.eqiad.wmnet
2026-04-17 13:01:22 <Lucas_WMDE> fabfur, tappof: I would like to do an emergency deploy for https://gerrit.wikimedia.org/r/1273763 (unbreak some enwikinews things, see https://phabricator.wikimedia.org/T423512#11827523 for impact); I’m not sure if it qualifies as an emergency, but as I already tested the fix on mw-experimental I think the risk should also be fairly low. Are SRE
2026-04-17 13:01:22 <Lucas_WMDE> okay with deployment? (cc thcipriani, dduvall, A_smart_kitten)
2026-04-17 13:01:23 <wikibugs> ('Abandoned) ''Marostegui: mariadb: Productionize clouddb1032 [puppet] - ''https://gerrit.wikimedia.org/r/1273769 (https://phabricator.wikimedia.org/T409557) (owner: ''Marostegui)'
2026-04-17 13:01:35 <wikibugs> 'SRE-tools, ''Infrastructure-Foundations, ''Data-Platform-SRE (2026-03-27 - 2026-04-17): debmonitor-client crashes for growthbook image - https://phabricator.wikimedia.org/T423413#11833440 (''elukey) ''In progress''Resolved Thank you for the code fixes!'
2026-04-17 13:01:47 <Lucas_WMDE> (also, A_smart_kitten, do you know how to test the change via the web, beyond checking the value of the $wg variable? ^^)
2026-04-17 13:02:43 <Lucas_WMDE> (I *think* I’m actually seeing latest template versions on the main page, but I might be missing something)
2026-04-17 13:02:45 <jinxer-wm> FIRING: [4x] WidespreadPuppetFailure: Puppet has failed in drmrs - https://puppetboard.wikimedia.org/nodes?status=failed - https://grafana.wikimedia.org/d/yOxVDGvWk/puppet?orgId=1&viewPanel=6 - https://alerts.wikimedia.org/?q=alertname%3DWidespreadPuppetFailure
2026-04-17 13:03:08 <A_smart_kitten> Lucas_WMDE: not currently, checking the variable on the shell side of things would currently be my idea for how to test this if a deployment happens. i'll read some discussions to see if i can find something that isn't currently working that might be testable
2026-04-17 13:03:09 <wikibugs> ('CR) ''Kamila Součková: [C:''+2] Revert "shellbox: Setup shellbox-icu72" [deployment-charts] - ''https://gerrit.wikimedia.org/r/1270557 (https://phabricator.wikimedia.org/T422546) (owner: ''Kamila Součková)'
2026-04-17 13:03:31 <Lucas_WMDE> the edit summary at https://en.wikinews.org/w/index.php?title=Template:Lead_article_1&action=history looks like the main page issue may have been worked around
2026-04-17 13:03:36 <A_smart_kitten> i believe the main page issue specifically was fixed by a deletion & recreation of the templates (or something like that), xref https://phabricator.wikimedia.org/T423512#11827469
2026-04-17 13:03:48 <Lucas_WMDE> yeah
2026-04-17 13:05:10 <wikibugs> ('Merged) ''jenkins-bot: Revert "shellbox: Setup shellbox-icu72" [deployment-charts] - ''https://gerrit.wikimedia.org/r/1270557 (https://phabricator.wikimedia.org/T422546) (owner: ''Kamila Součková)'
2026-04-17 13:06:25 <jinxer-wm> RESOLVED: [2x] SystemdUnitFailed: send_tile_invalidations.service on maps1011:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 13:07:02 <logmsgbot> !log jiji@cumin1003 END (PASS) - Cookbook sre.ganeti.reboot-vm (exit_code=0) for VM wikikube-worker-exp1001.eqiad.wmnet
2026-04-17 13:07:23 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2150', diff saved to https://phabricator.wikimedia.org/P91054 and previous config saved to /var/cache/conftool/dbconfig/20260417-130722-fceratto.json
2026-04-17 13:07:51 <jinxer-wm> FIRING: [2x] CoreRouterInterfaceDown: Core router interface down - cr2-codfw:et-0/1/4 (Transport: cr2-eqiad:et-1/1/5 (Lumen, 449169461) {#3909}) - https://wikitech.wikimedia.org/wiki/Network_monitoring#Router_interface_down - https://alerts.wikimedia.org/?q=alertname%3DCoreRouterInterfaceDown
2026-04-17 13:08:16 <A_smart_kitten> Lucas_WMDE: okay, may(TM) be testable with https://en.wikinews.org/wiki/Tour_de_France:_Alberto_Contador_wins_the_grand_tour -- currently all entries in that infobox display a date in february 2025, but https://en.wikinews.org/wiki/Template:Tour_de_France_2007 seems to have since been updated with new dates
2026-04-17 13:08:34 <A_smart_kitten> (unless that is as a result of something else. in which case, who knows)
2026-04-17 13:08:42 <jinxer-wm> FIRING: [2x] SystemdUnitFailed: wmf_auto_restart_prometheus-blazegraph-exporter-wdqs-blazegraph.service on wdqs1012:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 13:09:20 <wikibugs> ('CR) ''Arnaudb: [C:''+1] "thanks for the rebase! that makes total sense." [puppet] - ''https://gerrit.wikimedia.org/r/1270774 (https://phabricator.wikimedia.org/T423027) (owner: ''Arnaudb)'
2026-04-17 13:09:41 <Lucas_WMDE> A_smart_kitten: sounds good, let’s test that in mw-experimental
2026-04-17 13:09:56 <wikibugs> 'ops-eqiad, ''SRE, ''DC-Ops, ''Data-Platform-SRE (2026-03-27 - 2026-04-17): Degraded RAID on an-worker1205 - https://phabricator.wikimedia.org/T422317#11833474 (''Jclark-ctr) @brouberol Drive has been Swapped Thanks!'
2026-04-17 13:10:27 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1197', diff saved to https://phabricator.wikimedia.org/P91055 and previous config saved to /var/cache/conftool/dbconfig/20260417-131026-fceratto.json
2026-04-17 13:10:41 <Lucas_WMDE> mw-experimental-eqiad updated
2026-04-17 13:11:15 <Lucas_WMDE> hm, still shows 2025-02-17 dates even after a purge with XWD…
2026-04-17 13:11:21 <wikibugs> 'ops-eqiad, ''SRE, ''DBA, ''DC-Ops: Degraded RAID on pc1011 - https://phabricator.wikimedia.org/T423630#11833478 (''Jclark-ctr) a:''Jclark-ctr Solid State Disk 0:1:6 Removed 6 1787.88 GB SATA'
2026-04-17 13:11:41 <A_smart_kitten> Lucas_WMDE: i'm gonna try special:purge connected to experimental-eqiad
2026-04-17 13:11:43 <wikibugs> 'ops-eqiad, ''SRE, ''DBA, ''DC-Ops: Degraded RAID on pc1011 - https://phabricator.wikimedia.org/T423630#11833480 (''Marostegui) Thank you!'
2026-04-17 13:12:15 <A_smart_kitten> WORKS (i think)
2026-04-17 13:12:30 <A_smart_kitten> Lucas_WMDE: can you confirm if you see the new date now?
2026-04-17 13:12:32 <wikibugs> ('PS1) ''Marostegui: site.pp: Move clouddb1024 to analytics [puppet] - ''https://gerrit.wikimedia.org/r/1273777 (https://phabricator.wikimedia.org/T409557)'
2026-04-17 13:12:44 <Lucas_WMDE> yup
2026-04-17 13:12:48 <Lucas_WMDE> what did you do differently :o
2026-04-17 13:12:53 <Lucas_WMDE> teach me your magic
2026-04-17 13:13:22 <Lucas_WMDE> also TIL Special:Purge
2026-04-17 13:13:34 <A_smart_kitten> just https://en.wikinews.org/wiki/special:purge/Tour_de_France:_Alberto_Contador_wins_the_grand_tour connected to k8s-mw-experimental-eqiad using WikimediaDebug i think
2026-04-17 13:13:44 <Lucas_WMDE> I’m trying another purge without WikimediaDebug to see if it restores the breakage
2026-04-17 13:13:49 <Lucas_WMDE> it does
2026-04-17 13:14:19 <Lucas_WMDE> okay, and now I also got it back into the fixed state
2026-04-17 13:14:23 <Lucas_WMDE> with WikimediaDebug and that backend
2026-04-17 13:14:28 <Lucas_WMDE> but only after a few extra reloads after the purge
2026-04-17 13:14:28 <Lucas_WMDE> o_O
2026-04-17 13:14:52 <wikibugs> 'ops-eqiad, ''SRE, ''DBA, ''DC-Ops: Degraded RAID on pc1011 - https://phabricator.wikimedia.org/T423630#11833487 (''Jclark-ctr) @Marostegui drive has been swapped'
2026-04-17 13:14:53 <Lucas_WMDE> anyway, the change is testable, that’s good. so we would just need SRE approval for the deploy
2026-04-17 13:15:11 <A_smart_kitten> ack
2026-04-17 13:16:33 <wikibugs> 'ops-eqiad, ''SRE, ''DBA, ''DC-Ops: Degraded RAID on pc1011 - https://phabricator.wikimedia.org/T423630#11833496 (''Marostegui) Rebuilding: ` Raw Size: 1.746 TB [0xdf8fe2b0 Sectors] Firmware state: =====> Rebuild <===== `'
2026-04-17 13:16:38 <A_smart_kitten> at least we now seem to have confirmed that this might be the fix, whether or not a today-deploy is available :)
2026-04-17 13:17:31 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2150', diff saved to https://phabricator.wikimedia.org/P91056 and previous config saved to /var/cache/conftool/dbconfig/20260417-131730-fceratto.json
2026-04-17 13:17:35 <wikibugs> ('PS2) ''Dpogorzelski: kserve-resources: fix securityContext propagation [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273664 (https://phabricator.wikimedia.org/T423149)'
2026-04-17 13:18:39 <wikibugs> ('PS1) ''Ottomata: html-enrich - reduce checkpoint timeout [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273779 (https://phabricator.wikimedia.org/T421216)'
2026-04-17 13:20:06 <tappof> Lucas_WMDE: A_smart_kitten We're checking if it's okay to proceed. We'll let you know.
2026-04-17 13:20:35 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1197 (T419961)', diff saved to https://phabricator.wikimedia.org/P91057 and previous config saved to /var/cache/conftool/dbconfig/20260417-132034-fceratto.json
2026-04-17 13:20:56 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 1 day, 0:00:00 on db1225.eqiad.wmnet with reason: Maintenance
2026-04-17 13:21:04 <wikibugs> ('PS1) ''Dreamy Jazz: maintain-views: Hide blocks with bl_deleted set to 2 [puppet] - ''https://gerrit.wikimedia.org/r/1273781 (https://phabricator.wikimedia.org/T414188)'
2026-04-17 13:21:10 <Lucas_WMDE> ack, thanks!
2026-04-17 13:22:02 <logmsgbot> !log jiji@cumin1003 START - Cookbook sre.ganeti.reboot-vm for VM wikikube-worker-exp2001.codfw.wmnet
2026-04-17 13:22:45 <jinxer-wm> FIRING: [4x] WidespreadPuppetFailure: Puppet has failed in drmrs - https://puppetboard.wikimedia.org/nodes?status=failed - https://grafana.wikimedia.org/d/yOxVDGvWk/puppet?orgId=1&viewPanel=6 - https://alerts.wikimedia.org/?q=alertname%3DWidespreadPuppetFailure
2026-04-17 13:24:25 <wikibugs> ('CR) ''FNegri: [C:''+1] site.pp: Move clouddb1024 to analytics [puppet] - ''https://gerrit.wikimedia.org/r/1273777 (https://phabricator.wikimedia.org/T409557) (owner: ''Marostegui)'
2026-04-17 13:24:59 <wikibugs> ('CR) ''Marostegui: [C:''+2] site.pp: Move clouddb1024 to analytics [puppet] - ''https://gerrit.wikimedia.org/r/1273777 (https://phabricator.wikimedia.org/T409557) (owner: ''Marostegui)'
2026-04-17 13:26:02 <logmsgbot> !log jiji@cumin1003 END (PASS) - Cookbook sre.ganeti.reboot-vm (exit_code=0) for VM wikikube-worker-exp2001.codfw.wmnet
2026-04-17 13:26:20 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 1 day, 0:00:00 on db1229.eqiad.wmnet with reason: Maintenance
2026-04-17 13:26:29 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db1229 (T419961)', diff saved to https://phabricator.wikimedia.org/P91058 and previous config saved to /var/cache/conftool/dbconfig/20260417-132628-fceratto.json
2026-04-17 13:26:34 <logmsgbot> !log jiji@deploy1003 helmfile [codfw] START helmfile.d/services/mw-parsoid: apply
2026-04-17 13:27:16 <wikibugs> 'ops-eqiad, ''SRE, ''DC-Ops, ''Data-Platform-SRE (2026-03-27 - 2026-04-17): Degraded RAID on an-worker1205 - https://phabricator.wikimedia.org/T422317#11833527 (''brouberol) Thank you!'
2026-04-17 13:27:23 <logmsgbot> !log jiji@deploy1003 helmfile [codfw] DONE helmfile.d/services/mw-parsoid: apply
2026-04-17 13:27:39 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2150 (T419635)', diff saved to https://phabricator.wikimedia.org/P91059 and previous config saved to /var/cache/conftool/dbconfig/20260417-132738-fceratto.json
2026-04-17 13:27:43 <stashbot> T419635: Drop il_to column from imagelinks table in wmf production - https://phabricator.wikimedia.org/T419635
2026-04-17 13:27:56 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 12:00:00 on db2159.codfw.wmnet with reason: Maintenance
2026-04-17 13:28:03 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db2159 (T419635)', diff saved to https://phabricator.wikimedia.org/P91060 and previous config saved to /var/cache/conftool/dbconfig/20260417-132802-fceratto.json
2026-04-17 13:28:05 <sobanski> Lucas_WMDE: re. "not sure if it qualifies as an emergency" would it be a big problem if we waited until Monday?
2026-04-17 13:29:01 <wikibugs> ('PS1) ''Marostegui: cloudb1024: Add s6 [puppet] - ''https://gerrit.wikimedia.org/r/1273785 (https://phabricator.wikimedia.org/T409557)'
2026-04-17 13:29:15 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2159 (T419635)', diff saved to https://phabricator.wikimedia.org/P91061 and previous config saved to /var/cache/conftool/dbconfig/20260417-132914-fceratto.json
2026-04-17 13:29:23 <Lucas_WMDE> sobanski: I don’t think so, though I don’t fully understand the impact of the task
2026-04-17 13:29:35 <wikibugs> ('CR) ''Marostegui: "Won't be submitted today, will wait for the day of the announcement." [puppet] - ''https://gerrit.wikimedia.org/r/1273785 (https://phabricator.wikimedia.org/T409557) (owner: ''Marostegui)'
2026-04-17 13:29:44 <Lucas_WMDE> it sounds like they worked around the issue for the main page, but the rest of the wiki is still affected
2026-04-17 13:30:03 <Lucas_WMDE> and they don’t have a ton of time left before the wiki closes, so I thought it would be nice if we could unbreak it before the weekend
2026-04-17 13:30:05 <wikibugs> ('CR) ''Marostegui: "@fnegri@wikimedia.org when could I stop 1015 to clone this one?" [puppet] - ''https://gerrit.wikimedia.org/r/1273785 (https://phabricator.wikimedia.org/T409557) (owner: ''Marostegui)'
2026-04-17 13:32:45 <jinxer-wm> FIRING: [4x] WidespreadPuppetFailure: Puppet has failed in drmrs - https://puppetboard.wikimedia.org/nodes?status=failed - https://grafana.wikimedia.org/d/yOxVDGvWk/puppet?orgId=1&viewPanel=6 - https://alerts.wikimedia.org/?q=alertname%3DWidespreadPuppetFailure
2026-04-17 13:33:04 <wikibugs> ('PS1) ''Jforrester: ImageListPager: Make sure file and filerevision are in correct order [core] (wmf/1.46.0-wmf.24) - ''https://gerrit.wikimedia.org/r/1273787 (https://phabricator.wikimedia.org/T423654)'
2026-04-17 13:33:27 <jinxer-wm> RESOLVED: [2x] SystemdUnitFailed: wmf_auto_restart_prometheus-blazegraph-exporter-wdqs-blazegraph.service on wdqs1012:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 13:34:00 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1229 (T419961)', diff saved to https://phabricator.wikimedia.org/P91062 and previous config saved to /var/cache/conftool/dbconfig/20260417-133359-fceratto.json
2026-04-17 13:35:16 <wikibugs> ('CR) ''Ottomata: [C:''+2] html-enrich - reduce checkpoint timeout [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273779 (https://phabricator.wikimedia.org/T421216) (owner: ''Ottomata)'
2026-04-17 13:37:16 <wikibugs> ('Merged) ''jenkins-bot: html-enrich - reduce checkpoint timeout [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273779 (https://phabricator.wikimedia.org/T421216) (owner: ''Ottomata)'
2026-04-17 13:37:47 <wikibugs> ('Abandoned) ''Jcrespo: firewall: Update firewall definitions for mediabackups to Puppet 7 syntax [puppet] - ''https://gerrit.wikimedia.org/r/1211145 (https://phabricator.wikimedia.org/T349619) (owner: ''Jcrespo)'
2026-04-17 13:39:23 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2159', diff saved to https://phabricator.wikimedia.org/P91063 and previous config saved to /var/cache/conftool/dbconfig/20260417-133923-fceratto.json
2026-04-17 13:39:44 <wikibugs> 'SRE, ''Ganeti, ''Infrastructure-Foundations: Migrating eqsin to routed Ganeti - https://phabricator.wikimedia.org/T421863#11833549 (''MoritzMuehlenhoff)'
2026-04-17 13:40:06 <wikibugs> 'SRE-tools, ''bacula, ''Data-Persistence-Backup, ''Infrastructure-Foundations, and 2 others: netbox2003 backups (maybe others?) are missconfigured or failing to find the backup directory - https://phabricator.wikimedia.org/T423689#11833550 (''ayounsi) We're not doing Netbox CSV dumps anymore. So you can r...'
2026-04-17 13:42:05 <wikibugs> ('PS1) ''Muehlenhoff: Depool puppetserver1002 [dns] - ''https://gerrit.wikimedia.org/r/1273788 (https://phabricator.wikimedia.org/T423282)'
2026-04-17 13:42:29 <inflatador> !log bking@apt1002 sudo -E reprepro -C component/opensearch2 include trixie-wikimedia /home/bking/wmf-opensearch-search-plugins-2.19.5+5-trixie/wmf-opensearch-search-plugins_2.19.5+5_amd64.changes
2026-04-17 13:42:30 <stashbot> Logged the message at https://wikitech.wikimedia.org/wiki/Server_Admin_Log
2026-04-17 13:42:48 <jinxer-wm> FIRING: PuppetFailure: Puppet has failed on cirrussearch1113:9100 - https://puppetboard.wikimedia.org/nodes?status=failed - https://grafana.wikimedia.org/d/yOxVDGvWk/puppet - https://alerts.wikimedia.org/?q=alertname%3DPuppetFailure
2026-04-17 13:42:54 <icinga-wm> PROBLEM - MariaDB Replica Lag: m1 on db2232 is CRITICAL: CRITICAL slave_sql_lag Replication lag: 626.33 seconds https://wikitech.wikimedia.org/wiki/MariaDB/troubleshooting%23Depooling_a_replica
2026-04-17 13:43:04 <icinga-wm> PROBLEM - MariaDB Replica Lag: m1 on db2160 is CRITICAL: CRITICAL slave_sql_lag Replication lag: 637.21 seconds https://wikitech.wikimedia.org/wiki/MariaDB/troubleshooting%23Depooling_a_replica
2026-04-17 13:43:09 <icinga-wm> PROBLEM - MariaDB Replica Lag: m1 on db1217 is CRITICAL: CRITICAL slave_sql_lag Replication lag: 640.05 seconds https://wikitech.wikimedia.org/wiki/MariaDB/troubleshooting%23Depooling_a_replica
2026-04-17 13:43:26 <wikibugs> ('CR) ''Muehlenhoff: [C:''+2] Depool puppetserver1002 [dns] - ''https://gerrit.wikimedia.org/r/1273788 (https://phabricator.wikimedia.org/T423282) (owner: ''Muehlenhoff)'
2026-04-17 13:43:33 <logmsgbot> !log jmm@dns1004 START - running authdns-update
2026-04-17 13:44:08 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1229', diff saved to https://phabricator.wikimedia.org/P91064 and previous config saved to /var/cache/conftool/dbconfig/20260417-134408-fceratto.json
2026-04-17 13:44:32 <wikibugs> 'SRE, ''Infrastructure-Foundations, ''Puppet-Infrastructure, ''Patch-For-Review: Timeouts on puppetserver1002 past reboot - https://phabricator.wikimedia.org/T423282#11833559 (''MoritzMuehlenhoff) ''Resolved''Open This started again and I've just depooled 1002 again.'
2026-04-17 13:44:59 <logmsgbot> !log jmm@dns1004 END - running authdns-update
2026-04-17 13:45:11 <wikibugs> ('PS3) ''Dpogorzelski: kserve-resources: fix securityContext propagation [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273664 (https://phabricator.wikimedia.org/T423149)'
2026-04-17 13:45:55 <wikibugs> ('PS1) ''Bking: Revert "opensearch: strip bundled plugins before WMF pkg" [puppet] - ''https://gerrit.wikimedia.org/r/1273789'
2026-04-17 13:46:05 <wikibugs> ('CR) ''Bking: [V:''+2 C:''+2] Revert "opensearch: strip bundled plugins before WMF pkg" [puppet] - ''https://gerrit.wikimedia.org/r/1273789 (owner: ''Bking)'
2026-04-17 13:46:54 <icinga-wm> RECOVERY - MariaDB Replica Lag: m1 on db2232 is OK: OK slave_sql_lag Replication lag: 0.36 seconds https://wikitech.wikimedia.org/wiki/MariaDB/troubleshooting%23Depooling_a_replica
2026-04-17 13:47:15 <wikibugs> ('CR) ''CI reject: [V:''-1] kserve-resources: fix securityContext propagation [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273664 (https://phabricator.wikimedia.org/T423149) (owner: ''Dpogorzelski)'
2026-04-17 13:47:45 <jinxer-wm> FIRING: [4x] WidespreadPuppetFailure: Puppet has failed in drmrs - https://puppetboard.wikimedia.org/nodes?status=failed - https://grafana.wikimedia.org/d/yOxVDGvWk/puppet?orgId=1&viewPanel=6 - https://alerts.wikimedia.org/?q=alertname%3DWidespreadPuppetFailure
2026-04-17 13:48:23 <fabfur> ^^ waiting for clients resolving new address
2026-04-17 13:49:31 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2159', diff saved to https://phabricator.wikimedia.org/P91065 and previous config saved to /var/cache/conftool/dbconfig/20260417-134930-fceratto.json
2026-04-17 13:50:08 <icinga-wm> RECOVERY - MariaDB Replica Lag: m1 on db1217 is OK: OK slave_sql_lag Replication lag: 0.02 seconds https://wikitech.wikimedia.org/wiki/MariaDB/troubleshooting%23Depooling_a_replica
2026-04-17 13:50:31 <A_smart_kitten> i've probably got to go at some point shortly (~5/10mins?) - if a deploy is given the go-ahead while i'm gone, Lucas_WMDE: you are free to deploy my patch while i'm gone if you feel comfortable doing so, if not then no worries & i'll schedule it for monday
2026-04-17 13:50:35 <wikibugs> ('CR) ''Dpogorzelski: [V:''+2 C:''+2] kserve-resources: fix securityContext propagation [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273664 (https://phabricator.wikimedia.org/T423149) (owner: ''Dpogorzelski)'
2026-04-17 13:50:47 <Lucas_WMDE> ack
2026-04-17 13:50:59 <Lucas_WMDE> thanks!
2026-04-17 13:51:03 <A_smart_kitten> np :)
2026-04-17 13:51:53 <wikibugs> ('PS3) ''Elukey: istio: revisit Prometheus buckets for Wikikube [deployment-charts] - ''https://gerrit.wikimedia.org/r/1269998 (https://phabricator.wikimedia.org/T392886)'
2026-04-17 13:52:29 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] START helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich: apply
2026-04-17 13:52:33 <wikibugs> ('CR) ''Elukey: istio: revisit Prometheus buckets for Wikikube (''1 comment) [deployment-charts] - ''https://gerrit.wikimedia.org/r/1269998 (https://phabricator.wikimedia.org/T392886) (owner: ''Elukey)'
2026-04-17 13:52:34 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] DONE helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich: apply
2026-04-17 13:52:45 <jinxer-wm> FIRING: [4x] WidespreadPuppetFailure: Puppet has failed in drmrs - https://puppetboard.wikimedia.org/nodes?status=failed - https://grafana.wikimedia.org/d/yOxVDGvWk/puppet?orgId=1&viewPanel=6 - https://alerts.wikimedia.org/?q=alertname%3DWidespreadPuppetFailure
2026-04-17 13:54:17 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1229', diff saved to https://phabricator.wikimedia.org/P91066 and previous config saved to /var/cache/conftool/dbconfig/20260417-135416-fceratto.json
2026-04-17 13:54:33 <fabfur> !log restarting varnish on cp3066 to clear alerts
2026-04-17 13:54:35 <stashbot> Logged the message at https://wikitech.wikimedia.org/wiki/Server_Admin_Log
2026-04-17 13:54:47 <logmsgbot> !log fabfur@cumin1003 START - Cookbook sre.cdn.roll-restart-varnish rolling restart of Varnish on 1 hosts matching query P{cp3066.*}
2026-04-17 13:54:49 <wikibugs> ('PS1) ''Muehlenhoff: Remove puppetmaster::gitpuppet [puppet] - ''https://gerrit.wikimedia.org/r/1273790 (https://phabricator.wikimedia.org/T365798)'
2026-04-17 13:55:51 <wikibugs> ('CR) ''Dpogorzelski: [C:''+2] knative-serving: update chart to 1.21.1 [deployment-charts] - ''https://gerrit.wikimedia.org/r/1271709 (owner: ''Dpogorzelski)'
2026-04-17 13:55:55 <wikibugs> ('PS1) ''Jcrespo: netbox: Remove backups from netbox server, only leave postgres ones [puppet] - ''https://gerrit.wikimedia.org/r/1273791 (https://phabricator.wikimedia.org/T423689)'
2026-04-17 13:56:23 <wikibugs> ('CR) ''Andrew Bogott: [C:''-1] Openstack: use debian.net repo rather than the wmf-hosted repo (''1 comment) [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598) (owner: ''Andrew Bogott)'
2026-04-17 13:56:55 <wikibugs> 'SRE-tools, ''bacula, ''Data-Persistence-Backup, ''Infrastructure-Foundations, and 3 others: netbox2003 backups (maybe others?) are missconfigured or failing to find the backup directory - https://phabricator.wikimedia.org/T423689#11833584 (''jcrespo) That was the only thing being backed up. ` bacula:...'
2026-04-17 13:57:05 <wikibugs> ('PS1) ''Muehlenhoff: Remove obsolete Hiera file [puppet] - ''https://gerrit.wikimedia.org/r/1273792 (https://phabricator.wikimedia.org/T365798)'
2026-04-17 13:57:19 <logmsgbot> !log fabfur@cumin1003 END (PASS) - Cookbook sre.cdn.roll-restart-varnish (exit_code=0) rolling restart of Varnish on 1 hosts matching query P{cp3066.*}
2026-04-17 13:57:45 <jinxer-wm> FIRING: [4x] WidespreadPuppetFailure: Puppet has failed in drmrs - https://puppetboard.wikimedia.org/nodes?status=failed - https://grafana.wikimedia.org/d/yOxVDGvWk/puppet?orgId=1&viewPanel=6 - https://alerts.wikimedia.org/?q=alertname%3DWidespreadPuppetFailure
2026-04-17 13:57:55 <wikibugs> ('PS4) ''Dpogorzelski: knative-serving: update chart to 1.21.1 [deployment-charts] - ''https://gerrit.wikimedia.org/r/1271709'
2026-04-17 13:58:19 <wikibugs> ('CR) ''Dpogorzelski: [V:''+2 C:''+2] knative-serving: update chart to 1.21.1 [deployment-charts] - ''https://gerrit.wikimedia.org/r/1271709 (owner: ''Dpogorzelski)'
2026-04-17 13:58:31 <wikibugs> ('PS4) ''Andrew Bogott: Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598)'
2026-04-17 13:58:31 <wikibugs> ('CR) ''Ayounsi: [C:''+1] "thanks!" [puppet] - ''https://gerrit.wikimedia.org/r/1273791 (https://phabricator.wikimedia.org/T423689) (owner: ''Jcrespo)'
2026-04-17 13:58:46 <logmsgbot> !log fabfur@cumin1003 START - Cookbook sre.cdn.roll-restart-varnish rolling restart of Varnish on 1 hosts matching query P{cp3069.*}
2026-04-17 13:59:06 <wikibugs> ('CR) ''CI reject: [V:''-1] Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598) (owner: ''Andrew Bogott)'
2026-04-17 13:59:39 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2159 (T419635)', diff saved to https://phabricator.wikimedia.org/P91067 and previous config saved to /var/cache/conftool/dbconfig/20260417-135938-fceratto.json
2026-04-17 13:59:45 <stashbot> T419635: Drop il_to column from imagelinks table in wmf production - https://phabricator.wikimedia.org/T419635
2026-04-17 13:59:54 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] START helmfile.d/admin 'sync'.
2026-04-17 13:59:56 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 12:00:00 on db2168.codfw.wmnet with reason: Maintenance
2026-04-17 14:00:04 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db2168 (T419635)', diff saved to https://phabricator.wikimedia.org/P91068 and previous config saved to /var/cache/conftool/dbconfig/20260417-140003-fceratto.json
2026-04-17 14:00:20 <fabfur> !log restart varnish on cp3069, cp3070, cp3072, cp3073 to clear alerts
2026-04-17 14:00:22 <stashbot> Logged the message at https://wikitech.wikimedia.org/wiki/Server_Admin_Log
2026-04-17 14:00:28 <wikibugs> 'SRE-tools, ''bacula, ''Data-Persistence-Backup, ''Infrastructure-Foundations, and 3 others: netbox2003 backups (maybe others?) are missconfigured or failing to find the backup directory - https://phabricator.wikimedia.org/T423689#11833590 (''ayounsi) Yeah, Postgres is where all the data are. So +1 to not...'
2026-04-17 14:00:31 <logmsgbot> !log fabfur@cumin1003 END (PASS) - Cookbook sre.cdn.roll-restart-varnish (exit_code=0) rolling restart of Varnish on 1 hosts matching query P{cp3069.*}
2026-04-17 14:01:11 <logmsgbot> !log fabfur@cumin1003 START - Cookbook sre.cdn.roll-restart-varnish rolling restart of Varnish on 1 hosts matching query P{cp3070.*}
2026-04-17 14:01:15 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2168 (T419635)', diff saved to https://phabricator.wikimedia.org/P91069 and previous config saved to /var/cache/conftool/dbconfig/20260417-140115-fceratto.json
2026-04-17 14:01:51 <wikibugs> ('CR) ''Jcrespo: "Will better deploy next week, even if it is a trivial patch (I may ask you to be around in case something goes wrong)." [puppet] - ''https://gerrit.wikimedia.org/r/1273791 (https://phabricator.wikimedia.org/T423689) (owner: ''Jcrespo)'
2026-04-17 14:01:55 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] DONE helmfile.d/admin 'sync'.
2026-04-17 14:02:42 <logmsgbot> !log fabfur@cumin1003 END (PASS) - Cookbook sre.cdn.roll-restart-varnish (exit_code=0) rolling restart of Varnish on 1 hosts matching query P{cp3070.*}
2026-04-17 14:02:43 <wikibugs> 'SRE-tools, ''bacula, ''Data-Persistence-Backup, ''Infrastructure-Foundations, and 3 others: netbox2003 backups (maybe others?) are missconfigured or failing to find the backup directory - https://phabricator.wikimedia.org/T423689#11833597 (''jcrespo) p:''Triage''Medium a:''jcrespo'
2026-04-17 14:02:45 <jinxer-wm> FIRING: [4x] WidespreadPuppetFailure: Puppet has failed in drmrs - https://puppetboard.wikimedia.org/nodes?status=failed - https://grafana.wikimedia.org/d/yOxVDGvWk/puppet?orgId=1&viewPanel=6 - https://alerts.wikimedia.org/?q=alertname%3DWidespreadPuppetFailure
2026-04-17 14:03:07 <logmsgbot> !log fabfur@cumin1003 START - Cookbook sre.cdn.roll-restart-varnish rolling restart of Varnish on 1 hosts matching query P{cp3072.*}
2026-04-17 14:03:13 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] START helmfile.d/admin 'sync'.
2026-04-17 14:04:20 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] DONE helmfile.d/admin 'sync'.
2026-04-17 14:04:25 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1229 (T419961)', diff saved to https://phabricator.wikimedia.org/P91070 and previous config saved to /var/cache/conftool/dbconfig/20260417-140424-fceratto.json
2026-04-17 14:04:40 <logmsgbot> !log fabfur@cumin1003 END (PASS) - Cookbook sre.cdn.roll-restart-varnish (exit_code=0) rolling restart of Varnish on 1 hosts matching query P{cp3072.*}
2026-04-17 14:04:46 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 1 day, 0:00:00 on db1233.eqiad.wmnet with reason: Maintenance
2026-04-17 14:04:48 <wikibugs> 'SRE, ''Infrastructure-Foundations: Failing Trixie VM installations on routed Ganeti - https://phabricator.wikimedia.org/T422596#11833600 (''jcrespo) On a trixie system I had an issue in which the host decided to kill big processes rather than becoming slow (something related to stall detection, not due to VM...'
2026-04-17 14:04:54 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db1233 (T419961)', diff saved to https://phabricator.wikimedia.org/P91071 and previous config saved to /var/cache/conftool/dbconfig/20260417-140454-fceratto.json
2026-04-17 14:05:01 <logmsgbot> !log fabfur@cumin1003 START - Cookbook sre.cdn.roll-restart-varnish rolling restart of Varnish on 1 hosts matching query P{cp3073.*}
2026-04-17 14:05:06 <icinga-wm> RECOVERY - MariaDB Replica Lag: m1 on db2160 is OK: OK slave_sql_lag Replication lag: 0.41 seconds https://wikitech.wikimedia.org/wiki/MariaDB/troubleshooting%23Depooling_a_replica
2026-04-17 14:06:33 <logmsgbot> !log eevans@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 30 days, 0:00:00 on aqs1011.eqiad.wmnet with reason: Bootstrapping — T412830
2026-04-17 14:06:37 <stashbot> T412830: Hardware refresh of aqs101[0-2,4-5] w/ aqs102[3-7] - https://phabricator.wikimedia.org/T412830
2026-04-17 14:06:47 <logmsgbot> !log fabfur@cumin1003 END (PASS) - Cookbook sre.cdn.roll-restart-varnish (exit_code=0) rolling restart of Varnish on 1 hosts matching query P{cp3073.*}
2026-04-17 14:09:25 <urandom> !log decommissioning Cassandra, aqs1011 [a,b] — T412830
2026-04-17 14:09:28 <stashbot> Logged the message at https://wikitech.wikimedia.org/wiki/Server_Admin_Log
2026-04-17 14:10:18 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] START helmfile.d/admin 'sync'.
2026-04-17 14:11:23 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2168', diff saved to https://phabricator.wikimedia.org/P91072 and previous config saved to /var/cache/conftool/dbconfig/20260417-141123-fceratto.json
2026-04-17 14:11:27 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] DONE helmfile.d/admin 'sync'.
2026-04-17 14:12:22 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] START helmfile.d/admin 'sync'.
2026-04-17 14:12:23 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1233 (T419961)', diff saved to https://phabricator.wikimedia.org/P91073 and previous config saved to /var/cache/conftool/dbconfig/20260417-141222-fceratto.json
2026-04-17 14:12:28 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] DONE helmfile.d/admin 'sync'.
2026-04-17 14:12:37 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] START helmfile.d/admin 'sync'.
2026-04-17 14:12:48 <jinxer-wm> RESOLVED: PuppetFailure: Puppet has failed on cirrussearch1113:9100 - https://puppetboard.wikimedia.org/nodes?status=failed - https://grafana.wikimedia.org/d/yOxVDGvWk/puppet - https://alerts.wikimedia.org/?q=alertname%3DPuppetFailure
2026-04-17 14:13:27 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] DONE helmfile.d/admin 'sync'.
2026-04-17 14:14:13 <wikibugs> ('PS2) ''Jcrespo: netbox: Remove backups from netbox server, only leave postgres ones [puppet] - ''https://gerrit.wikimedia.org/r/1273791 (https://phabricator.wikimedia.org/T423689)'
2026-04-17 14:14:30 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] START helmfile.d/admin 'sync'.
2026-04-17 14:16:16 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] DONE helmfile.d/admin 'sync'.
2026-04-17 14:16:37 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] START helmfile.d/admin 'sync'.
2026-04-17 14:17:45 <jinxer-wm> FIRING: [4x] WidespreadPuppetFailure: Puppet has failed in drmrs - https://puppetboard.wikimedia.org/nodes?status=failed - https://grafana.wikimedia.org/d/yOxVDGvWk/puppet?orgId=1&viewPanel=6 - https://alerts.wikimedia.org/?q=alertname%3DWidespreadPuppetFailure
2026-04-17 14:18:26 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] DONE helmfile.d/admin 'sync'.
2026-04-17 14:18:33 <wikibugs> ('PS3) ''Jcrespo: netbox: Remove backups from netbox server, only leave postgres ones [puppet] - ''https://gerrit.wikimedia.org/r/1273791 (https://phabricator.wikimedia.org/T423689)'
2026-04-17 14:18:37 <wikibugs> ('CR) ''Jcrespo: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273791 (https://phabricator.wikimedia.org/T423689) (owner: ''Jcrespo)'
2026-04-17 14:20:42 <wikibugs> ('PS4) ''Jcrespo: netbox: Remove backups from netbox server, only leave postgres ones [puppet] - ''https://gerrit.wikimedia.org/r/1273791 (https://phabricator.wikimedia.org/T423689)'
2026-04-17 14:20:51 <wikibugs> ('PS5) ''Jcrespo: netbox: Remove backups from netbox server, only leave postgres ones [puppet] - ''https://gerrit.wikimedia.org/r/1273791 (https://phabricator.wikimedia.org/T423689)'
2026-04-17 14:20:53 <wikibugs> ('CR) ''Jcrespo: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273791 (https://phabricator.wikimedia.org/T423689) (owner: ''Jcrespo)'
2026-04-17 14:21:31 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2168', diff saved to https://phabricator.wikimedia.org/P91074 and previous config saved to /var/cache/conftool/dbconfig/20260417-142130-fceratto.json
2026-04-17 14:22:31 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1233', diff saved to https://phabricator.wikimedia.org/P91075 and previous config saved to /var/cache/conftool/dbconfig/20260417-142230-fceratto.json
2026-04-17 14:22:45 <jinxer-wm> RESOLVED: [2x] WidespreadPuppetFailure: Puppet has failed in esams - https://puppetboard.wikimedia.org/nodes?status=failed - https://grafana.wikimedia.org/d/yOxVDGvWk/puppet?orgId=1&viewPanel=6 - https://alerts.wikimedia.org/?q=alertname%3DWidespreadPuppetFailure
2026-04-17 14:24:21 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11833663 (''Jclark-ctr) a:''Jclark-ctr'
2026-04-17 14:25:37 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11833677 (''Jclark-ctr)'
2026-04-17 14:31:39 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2168 (T419635)', diff saved to https://phabricator.wikimedia.org/P91076 and previous config saved to /var/cache/conftool/dbconfig/20260417-143139-fceratto.json
2026-04-17 14:31:44 <stashbot> T419635: Drop il_to column from imagelinks table in wmf production - https://phabricator.wikimedia.org/T419635
2026-04-17 14:31:56 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 12:00:00 on db2182.codfw.wmnet with reason: Maintenance
2026-04-17 14:32:04 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db2182 (T419635)', diff saved to https://phabricator.wikimedia.org/P91077 and previous config saved to /var/cache/conftool/dbconfig/20260417-143204-fceratto.json
2026-04-17 14:32:39 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1233', diff saved to https://phabricator.wikimedia.org/P91078 and previous config saved to /var/cache/conftool/dbconfig/20260417-143238-fceratto.json
2026-04-17 14:32:55 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] START helmfile.d/admin 'sync'.
2026-04-17 14:32:59 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] DONE helmfile.d/admin 'sync'.
2026-04-17 14:33:05 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] START helmfile.d/admin 'sync'.
2026-04-17 14:33:09 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] DONE helmfile.d/admin 'sync'.
2026-04-17 14:33:39 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] START helmfile.d/admin 'sync'.
2026-04-17 14:33:55 <wikibugs> ('PS2) ''Bartosz Dziewoński: Remove temporary `wgOAuth2UsePrefixedSub` feature flag [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1270882 (https://phabricator.wikimedia.org/T417690) (owner: ''D3r1ck01)'
2026-04-17 14:34:01 <wikibugs> ('CR) ''Bartosz Dziewoński: [C:''+1] Remove temporary `wgOAuth2UsePrefixedSub` feature flag [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1270882 (https://phabricator.wikimedia.org/T417690) (owner: ''D3r1ck01)'
2026-04-17 14:34:17 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2182 (T419635)', diff saved to https://phabricator.wikimedia.org/P91079 and previous config saved to /var/cache/conftool/dbconfig/20260417-143416-fceratto.json
2026-04-17 14:36:00 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] DONE helmfile.d/admin 'sync'.
2026-04-17 14:36:30 <logmsgbot> !log dpogorzelski@deploy1003 helmfile [ml-staging-codfw] Ran 'sync' command on namespace 'edit-check' for release 'main' .
2026-04-17 14:37:19 <wikibugs> ('CR) ''FNegri: "Is next Tuesday ok? Any day next week is fine." [puppet] - ''https://gerrit.wikimedia.org/r/1273785 (https://phabricator.wikimedia.org/T409557) (owner: ''Marostegui)'
2026-04-17 14:37:40 <wikibugs> ('PS5) ''Andrew Bogott: Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598)'
2026-04-17 14:37:40 <wikibugs> ('PS1) ''Andrew Bogott: Cloud-vps: use Flamingo config files for Horizon [puppet] - ''https://gerrit.wikimedia.org/r/1273831'
2026-04-17 14:37:40 <wikibugs> ('PS1) ''Andrew Bogott: Openstack: change spec tests to expect verison Flamingo [puppet] - ''https://gerrit.wikimedia.org/r/1273832'
2026-04-17 14:37:41 <wikibugs> ('PS1) ''Andrew Bogott: cloud-vps: switch VM openstack references to version Flamingo [puppet] - ''https://gerrit.wikimedia.org/r/1273833'
2026-04-17 14:37:42 <wikibugs> ('PS1) ''Andrew Bogott: Openstack: remove packages for version Dalmatian [puppet] - ''https://gerrit.wikimedia.org/r/1273834'
2026-04-17 14:37:44 <wikibugs> ('PS1) ''Andrew Bogott: Openstack: remove packages for version Epoxy [puppet] - ''https://gerrit.wikimedia.org/r/1273835'
2026-04-17 14:37:55 <wikibugs> ('CR) ''Marostegui: "Tuesday works for me yep. s6 is small so it shouldn't take long (famous last words?)" [puppet] - ''https://gerrit.wikimedia.org/r/1273785 (https://phabricator.wikimedia.org/T409557) (owner: ''Marostegui)'
2026-04-17 14:39:06 <wikibugs> ('CR) ''CI reject: [V:''-1] Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598) (owner: ''Andrew Bogott)'
2026-04-17 14:39:16 <wikibugs> ('PS15) ''Blake: kubernetes-generic: Add alerts for BGP failure scenarios. [alerts] - ''https://gerrit.wikimedia.org/r/1269994 (https://phabricator.wikimedia.org/T356877)'
2026-04-17 14:39:47 <wikibugs> ('CR) ''Blake: kubernetes-generic: Add alerts for BGP failure scenarios. (''3 comments) [alerts] - ''https://gerrit.wikimedia.org/r/1269994 (https://phabricator.wikimedia.org/T356877) (owner: ''Blake)'
2026-04-17 14:42:47 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1233 (T419961)', diff saved to https://phabricator.wikimedia.org/P91080 and previous config saved to /var/cache/conftool/dbconfig/20260417-144247-fceratto.json
2026-04-17 14:43:09 <wikibugs> ('CR) ''Andrew Bogott: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273831 (owner: ''Andrew Bogott)'
2026-04-17 14:43:09 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 1 day, 0:00:00 on db1239.eqiad.wmnet with reason: Maintenance
2026-04-17 14:44:25 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2182', diff saved to https://phabricator.wikimedia.org/P91081 and previous config saved to /var/cache/conftool/dbconfig/20260417-144424-fceratto.json
2026-04-17 14:48:11 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 1 day, 0:00:00 on db1254.eqiad.wmnet with reason: Maintenance
2026-04-17 14:48:20 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db1254 (T419961)', diff saved to https://phabricator.wikimedia.org/P91082 and previous config saved to /var/cache/conftool/dbconfig/20260417-144819-fceratto.json
2026-04-17 14:48:34 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] START helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich: apply
2026-04-17 14:48:39 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] DONE helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich: apply
2026-04-17 14:51:16 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] START helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich: apply
2026-04-17 14:51:20 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] DONE helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich: apply
2026-04-17 14:52:00 <Lucas_WMDE> sobanski: any update on that deploy request?
2026-04-17 14:52:20 <wikibugs> ('CR) ''JHathaway: "@jcrespo@wikimedia.org does it cause problems to leave them in test files?" [puppet] - ''https://gerrit.wikimedia.org/r/1273699 (https://phabricator.wikimedia.org/T422851) (owner: ''Jcrespo)'
2026-04-17 14:53:04 <icinga-wm> PROBLEM - MariaDB Replica Lag: m1 on db2160 is CRITICAL: CRITICAL slave_sql_lag Replication lag: 609.26 seconds https://wikitech.wikimedia.org/wiki/MariaDB/troubleshooting%23Depooling_a_replica
2026-04-17 14:53:08 <icinga-wm> PROBLEM - MariaDB Replica Lag: m1 on db1217 is CRITICAL: CRITICAL slave_sql_lag Replication lag: 612.08 seconds https://wikitech.wikimedia.org/wiki/MariaDB/troubleshooting%23Depooling_a_replica
2026-04-17 14:53:50 <wikibugs> 'SRE, ''collaboration-services, ''Infrastructure-Foundations, ''Wikimedia-Mailing-lists: lists.wikimedia.org subscription email rejected by DKIM - https://phabricator.wikimedia.org/T409137#11833798 (''Aklapper) @DamianZaremba: Could you please answer the last comment? Thanks in advance!'
2026-04-17 14:53:54 <icinga-wm> PROBLEM - MariaDB Replica Lag: m1 on db2232 is CRITICAL: CRITICAL slave_sql_lag Replication lag: 658.15 seconds https://wikitech.wikimedia.org/wiki/MariaDB/troubleshooting%23Depooling_a_replica
2026-04-17 14:54:33 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2182', diff saved to https://phabricator.wikimedia.org/P91083 and previous config saved to /var/cache/conftool/dbconfig/20260417-145432-fceratto.json
2026-04-17 14:54:54 <icinga-wm> RECOVERY - MariaDB Replica Lag: m1 on db2232 is OK: OK slave_sql_lag Replication lag: 25.32 seconds https://wikitech.wikimedia.org/wiki/MariaDB/troubleshooting%23Depooling_a_replica
2026-04-17 14:55:13 <wikibugs> ('CR) ''Andrew Bogott: [C:''+2] Cloud-vps: use Flamingo config files for Horizon [puppet] - ''https://gerrit.wikimedia.org/r/1273831 (owner: ''Andrew Bogott)'
2026-04-17 14:55:20 <wikibugs> ('CR) ''Andrew Bogott: [C:''+2] Openstack: change spec tests to expect verison Flamingo [puppet] - ''https://gerrit.wikimedia.org/r/1273832 (owner: ''Andrew Bogott)'
2026-04-17 14:55:25 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1254 (T419961)', diff saved to https://phabricator.wikimedia.org/P91084 and previous config saved to /var/cache/conftool/dbconfig/20260417-145524-fceratto.json
2026-04-17 14:56:41 <wikibugs> ('PS2) ''Andrew Bogott: cloud-vps: switch VM openstack references to version Flamingo [puppet] - ''https://gerrit.wikimedia.org/r/1273833'
2026-04-17 14:56:41 <wikibugs> ('PS2) ''Andrew Bogott: Openstack: remove packages for version Dalmatian [puppet] - ''https://gerrit.wikimedia.org/r/1273834'
2026-04-17 14:56:41 <wikibugs> ('PS2) ''Andrew Bogott: Openstack: remove packages for version Epoxy [puppet] - ''https://gerrit.wikimedia.org/r/1273835'
2026-04-17 14:56:42 <wikibugs> ('PS6) ''Andrew Bogott: Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598)'
2026-04-17 14:58:19 <wikibugs> ('CR) ''CI reject: [V:''-1] Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598) (owner: ''Andrew Bogott)'
2026-04-17 15:00:40 <jinxer-wm> FIRING: KubernetesRsyslogDown: rsyslog on wikikube-worker1059:9105 is missing kubernetes logs - https://wikitech.wikimedia.org/wiki/Kubernetes/Logging#Common_issues - https://grafana.wikimedia.org/d/OagQjQmnk?var-server=wikikube-worker1059 - https://alerts.wikimedia.org/?q=alertname%3DKubernetesRsyslogDown
2026-04-17 15:01:20 <wikibugs> ('PS7) ''Andrew Bogott: Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598)'
2026-04-17 15:02:08 <icinga-wm> RECOVERY - MariaDB Replica Lag: m1 on db1217 is OK: OK slave_sql_lag Replication lag: 0.00 seconds https://wikitech.wikimedia.org/wiki/MariaDB/troubleshooting%23Depooling_a_replica
2026-04-17 15:04:40 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2182 (T419635)', diff saved to https://phabricator.wikimedia.org/P91085 and previous config saved to /var/cache/conftool/dbconfig/20260417-150440-fceratto.json
2026-04-17 15:04:47 <stashbot> T419635: Drop il_to column from imagelinks table in wmf production - https://phabricator.wikimedia.org/T419635
2026-04-17 15:04:57 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 12:00:00 on db2198.codfw.wmnet with reason: Maintenance
2026-04-17 15:05:26 <icinga-wm> PROBLEM - Host mr1-magru.oob is DOWN: PING CRITICAL - Packet loss = 100%
2026-04-17 15:05:34 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1254', diff saved to https://phabricator.wikimedia.org/P91086 and previous config saved to /var/cache/conftool/dbconfig/20260417-150532-fceratto.json
2026-04-17 15:05:40 <jinxer-wm> RESOLVED: KubernetesRsyslogDown: rsyslog on wikikube-worker1059:9105 is missing kubernetes logs - https://wikitech.wikimedia.org/wiki/Kubernetes/Logging#Common_issues - https://grafana.wikimedia.org/d/OagQjQmnk?var-server=wikikube-worker1059 - https://alerts.wikimedia.org/?q=alertname%3DKubernetesRsyslogDown
2026-04-17 15:08:59 <Lucas_WMDE> FTR, I’ve received a go-ahead for the emergency deploy mentioned earlier, so I’ll do that soon unless someone shouts
2026-04-17 15:10:28 <wikibugs> ('PS1) ''Aude: Enable ReadingLists beta feature for all Wikipedia wikis [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1273842 (https://phabricator.wikimedia.org/T420881)'
2026-04-17 15:11:39 <wikibugs> ('CR) ''ScheduleDeploymentBot: "Scheduled for deployment in the [Monday, April 20 UTC afternoon backport window](https://wikitech.wikimedia.org/wiki/Deployments#deploycal"; [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1273842 (https://phabricator.wikimedia.org/T420881) (owner: ''Aude)'
2026-04-17 15:14:21 <wikibugs> 'ops-codfw, ''SRE, ''collaboration-services, ''DC-Ops: lists2001 has multiple bus errors - https://phabricator.wikimedia.org/T423159#11833878 (''LSobanski) lists2001 is the standby host so it should be safe to reboot. cc @ABran-WMF for confirmation.'
2026-04-17 15:14:38 <wikibugs> 'ops-codfw, ''SRE, ''collaboration-services, ''DC-Ops: lists2001 has multiple bus errors - https://phabricator.wikimedia.org/T423159#11833879 (''LSobanski) p:''Triage''Low'
2026-04-17 15:15:40 <icinga-wm> RECOVERY - Host mr1-magru.oob is UP: PING OK - Packet loss = 0%, RTA = 118.78 ms
2026-04-17 15:15:42 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1254', diff saved to https://phabricator.wikimedia.org/P91087 and previous config saved to /var/cache/conftool/dbconfig/20260417-151541-fceratto.json
2026-04-17 15:16:04 <icinga-wm> RECOVERY - MariaDB Replica Lag: m1 on db2160 is OK: OK slave_sql_lag Replication lag: 0.25 seconds https://wikitech.wikimedia.org/wiki/MariaDB/troubleshooting%23Depooling_a_replica
2026-04-17 15:16:56 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 12:00:00 on db2200.codfw.wmnet with reason: Maintenance
2026-04-17 15:17:16 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 12:00:00 on db2208.codfw.wmnet with reason: Maintenance
2026-04-17 15:17:24 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db2208 (T419635)', diff saved to https://phabricator.wikimedia.org/P91088 and previous config saved to /var/cache/conftool/dbconfig/20260417-151723-fceratto.json
2026-04-17 15:17:28 <stashbot> T419635: Drop il_to column from imagelinks table in wmf production - https://phabricator.wikimedia.org/T419635
2026-04-17 15:17:38 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] START helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich-next: apply
2026-04-17 15:17:43 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] DONE helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich-next: apply
2026-04-17 15:18:25 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] START helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich-next: apply
2026-04-17 15:18:30 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] DONE helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich-next: apply
2026-04-17 15:18:52 <wikibugs> ('CR) ''TrainBranchBot: [C:''+2] "Approved by lucaswerkmeister-wmde@deploy1003 using scap backport" [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1273763 (https://phabricator.wikimedia.org/T423512) (owner: ''A smart kitten)'
2026-04-17 15:19:36 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2208 (T419635)', diff saved to https://phabricator.wikimedia.org/P91089 and previous config saved to /var/cache/conftool/dbconfig/20260417-151936-fceratto.json
2026-04-17 15:19:50 <wikibugs> ('Merged) ''jenkins-bot: enwikinews: Move override for $wgFlaggedRevsHandleIncludes to InitialiseSettings.php [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1273763 (https://phabricator.wikimedia.org/T423512) (owner: ''A smart kitten)'
2026-04-17 15:20:42 <logmsgbot> !log lucaswerkmeister-wmde@deploy1003 Started scap sync-world: Backport for [[gerrit:1273763|enwikinews: Move override for $wgFlaggedRevsHandleIncludes to InitialiseSettings.php (T423512)]]
2026-04-17 15:20:46 <stashbot> T423512: Some pages on en.WN not transcluding specific templates properly - https://phabricator.wikimedia.org/T423512
2026-04-17 15:21:56 <Lucas_WMDE> deploying ^
2026-04-17 15:22:07 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] START helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich-next: apply
2026-04-17 15:22:12 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] DONE helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich-next: apply
2026-04-17 15:22:26 <logmsgbot> !log lucaswerkmeister-wmde@deploy1003 lucaswerkmeister-wmde, asmartkitten: Backport for [[gerrit:1273763|enwikinews: Move override for $wgFlaggedRevsHandleIncludes to InitialiseSettings.php (T423512)]] synced to the testservers (see https://wikitech.wikimedia.org/wiki/Mwdebug). Changes can now be verified there.
2026-04-17 15:22:45 <Lucas_WMDE> testing
2026-04-17 15:23:03 <Lucas_WMDE> needed a Ctrl+F5 again (idk why) but yes it seems to work \o/
2026-04-17 15:23:18 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] START helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich-next: apply
2026-04-17 15:23:22 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] DONE helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich-next: apply
2026-04-17 15:23:33 <logmsgbot> !log lucaswerkmeister-wmde@deploy1003 lucaswerkmeister-wmde, asmartkitten: Continuing with sync
2026-04-17 15:24:19 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] START helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich-next: apply
2026-04-17 15:24:24 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] DONE helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich-next: apply
2026-04-17 15:25:44 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] START helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich-next: apply
2026-04-17 15:25:48 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] DONE helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich-next: apply
2026-04-17 15:25:50 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1254 (T419961)', diff saved to https://phabricator.wikimedia.org/P91090 and previous config saved to /var/cache/conftool/dbconfig/20260417-152549-fceratto.json
2026-04-17 15:25:59 <jinxer-wm> FIRING: KubernetesDeploymentUnavailableReplicas: ...
2026-04-17 15:25:59 <jinxer-wm> Deployment linkrecommendation-internal in linkrecommendation at eqiad has persistently unavailable replicas - https://wikitech.wikimedia.org/wiki/Kubernetes/Troubleshooting#Troubleshooting_a_deployment - https://grafana.wikimedia.org/d/a260da06-259a-4ee4-9540-5cab01a246c8/kubernetes-deployment-details?var-site=eqiad&var-cluster=k8s&var-namespace=linkrecommendation&var-deployment=linkrecommendation-internal - ...
2026-04-17 15:25:59 <jinxer-wm> https://alerts.wikimedia.org/?q=alertname%3DKubernetesDeploymentUnavailableReplicas
2026-04-17 15:26:12 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 1 day, 0:00:00 on db1259.eqiad.wmnet with reason: Maintenance
2026-04-17 15:26:21 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db1259 (T419961)', diff saved to https://phabricator.wikimedia.org/P91091 and previous config saved to /var/cache/conftool/dbconfig/20260417-152620-fceratto.json
2026-04-17 15:27:33 <logmsgbot> !log lucaswerkmeister-wmde@deploy1003 Finished scap sync-world: Backport for [[gerrit:1273763|enwikinews: Move override for $wgFlaggedRevsHandleIncludes to InitialiseSettings.php (T423512)]] (duration: 06m 51s)
2026-04-17 15:27:38 <stashbot> T423512: Some pages on en.WN not transcluding specific templates properly - https://phabricator.wikimedia.org/T423512
2026-04-17 15:27:57 <wikibugs> 'SRE-OnFire, ''Release-Engineering-Team, ''Scap, ''serviceops-deprecated, ''Sustainability (Incident Followup): Should scap be able to update helmfile-defaults when -Dbuild_mw_container_image:False ? - https://phabricator.wikimedia.org/T390531#11833922 (''dancy) >>! In T390531#11831389, @dancy wrote...'
2026-04-17 15:29:45 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2208', diff saved to https://phabricator.wikimedia.org/P91092 and previous config saved to /var/cache/conftool/dbconfig/20260417-152944-fceratto.json
2026-04-17 15:31:45 <Lucas_WMDE> done deploying
2026-04-17 15:33:54 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1259 (T419961)', diff saved to https://phabricator.wikimedia.org/P91093 and previous config saved to /var/cache/conftool/dbconfig/20260417-153354-fceratto.json
2026-04-17 15:39:53 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2208', diff saved to https://phabricator.wikimedia.org/P91094 and previous config saved to /var/cache/conftool/dbconfig/20260417-153953-fceratto.json
2026-04-17 15:41:09 <wikibugs> ('CR) ''FNegri: [C:''+2] mariadb: wiki-replicas: add missing grants [puppet] - ''https://gerrit.wikimedia.org/r/1270891 (https://phabricator.wikimedia.org/T422806) (owner: ''FNegri)'
2026-04-17 15:41:38 <wikibugs> ('CR) ''FNegri: [C:''+2] mariadb: wiki-replicas: add grants for %_maintain [puppet] - ''https://gerrit.wikimedia.org/r/1270465 (https://phabricator.wikimedia.org/T422806) (owner: ''FNegri)'
2026-04-17 15:41:42 <wikibugs> ('CR) ''FNegri: [C:''+2] mariadb: wiki-replicas: remove redundant grants [puppet] - ''https://gerrit.wikimedia.org/r/1270464 (https://phabricator.wikimedia.org/T422806) (owner: ''FNegri)'
2026-04-17 15:43:37 <wikibugs> ('PS8) ''Andrew Bogott: Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598)'
2026-04-17 15:44:03 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1259', diff saved to https://phabricator.wikimedia.org/P91095 and previous config saved to /var/cache/conftool/dbconfig/20260417-154402-fceratto.json
2026-04-17 15:44:57 <wikibugs> ('CR) ''CI reject: [V:''-1] Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598) (owner: ''Andrew Bogott)'
2026-04-17 15:48:10 <wikibugs> ('PS1) ''Effie Mouzeli: mw-parsoid: bump envoy workers [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273855 (https://phabricator.wikimedia.org/T420336)'
2026-04-17 15:49:27 <wikibugs> ('CR) ''Jgiannelos: [C:''+1] mw-parsoid: bump envoy workers [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273855 (https://phabricator.wikimedia.org/T420336) (owner: ''Effie Mouzeli)'
2026-04-17 15:49:56 <logmsgbot> !log elukey@cumin1003 START - Cookbook sre.hosts.provision for host phab2003.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 15:50:02 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2208 (T419635)', diff saved to https://phabricator.wikimedia.org/P91096 and previous config saved to /var/cache/conftool/dbconfig/20260417-155001-fceratto.json
2026-04-17 15:50:06 <stashbot> T419635: Drop il_to column from imagelinks table in wmf production - https://phabricator.wikimedia.org/T419635
2026-04-17 15:50:08 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 12:00:00 on db2218.codfw.wmnet with reason: Maintenance
2026-04-17 15:50:16 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db2218 (T419635)', diff saved to https://phabricator.wikimedia.org/P91097 and previous config saved to /var/cache/conftool/dbconfig/20260417-155015-fceratto.json
2026-04-17 15:51:26 <wikibugs> ('PS2) ''Effie Mouzeli: mw-parsoid: bump envoy workers [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273855 (https://phabricator.wikimedia.org/T420336)'
2026-04-17 15:52:26 <wikibugs> ('CR) ''Marostegui: "@fnegri@wikimedia.org this looks good right?" [puppet] - ''https://gerrit.wikimedia.org/r/1273785 (https://phabricator.wikimedia.org/T409557) (owner: ''Marostegui)'
2026-04-17 15:52:28 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2218 (T419635)', diff saved to https://phabricator.wikimedia.org/P91098 and previous config saved to /var/cache/conftool/dbconfig/20260417-155228-fceratto.json
2026-04-17 15:52:41 <wikibugs> ('CR) ''Jgiannelos: [C:''+1] mw-parsoid: bump envoy workers [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273855 (https://phabricator.wikimedia.org/T420336) (owner: ''Effie Mouzeli)'
2026-04-17 15:53:25 <logmsgbot> !log elukey@cumin1003 END (FAIL) - Cookbook sre.hosts.provision (exit_code=99) for host phab2003.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 15:53:47 <logmsgbot> !log elukey@cumin1003 START - Cookbook sre.hosts.provision for host phab2003.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 15:54:07 <logmsgbot> !log elukey@cumin1003 END (FAIL) - Cookbook sre.hosts.provision (exit_code=99) for host phab2003.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 15:54:11 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1259', diff saved to https://phabricator.wikimedia.org/P91099 and previous config saved to /var/cache/conftool/dbconfig/20260417-155410-fceratto.json
2026-04-17 15:56:22 <wikibugs> ('CR) ''Effie Mouzeli: [C:''+2] mw-parsoid: bump envoy workers [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273855 (https://phabricator.wikimedia.org/T420336) (owner: ''Effie Mouzeli)'
2026-04-17 15:57:48 <wikibugs> 'ops-codfw, ''SRE, ''collaboration-services, ''DC-Ops: Q3:rack/setup/install phab2003 - https://phabricator.wikimedia.org/T418899#11834010 (''elukey) @VRiley-WMF sorry for the lag, completely lost this task! I tried today to run the provision script but I get stuck in the first check_connection: ` 2026-0...'
2026-04-17 15:58:30 <wikibugs> ('Merged) ''jenkins-bot: mw-parsoid: bump envoy workers [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273855 (https://phabricator.wikimedia.org/T420336) (owner: ''Effie Mouzeli)'
2026-04-17 15:58:53 <logmsgbot> !log jiji@deploy1003 helmfile [eqiad] START helmfile.d/services/mw-parsoid: apply
2026-04-17 15:59:04 <logmsgbot> !log jiji@deploy1003 helmfile [eqiad] DONE helmfile.d/services/mw-parsoid: apply
2026-04-17 15:59:15 <logmsgbot> !log jiji@deploy1003 helmfile [eqiad] START helmfile.d/services/mw-parsoid: apply
2026-04-17 15:59:44 <logmsgbot> !log jiji@deploy1003 helmfile [eqiad] DONE helmfile.d/services/mw-parsoid: apply
2026-04-17 16:01:50 <logmsgbot> !log jiji@deploy1003 helmfile [codfw] START helmfile.d/services/mw-parsoid: apply
2026-04-17 16:02:21 <logmsgbot> !log jiji@deploy1003 helmfile [codfw] DONE helmfile.d/services/mw-parsoid: apply
2026-04-17 16:02:37 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2218', diff saved to https://phabricator.wikimedia.org/P91100 and previous config saved to /var/cache/conftool/dbconfig/20260417-160236-fceratto.json
2026-04-17 16:04:19 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db1259 (T419961)', diff saved to https://phabricator.wikimedia.org/P91101 and previous config saved to /var/cache/conftool/dbconfig/20260417-160418-fceratto.json
2026-04-17 16:08:45 <wikibugs> ('CR) ''FNegri: [C:''+1] "Yep sorry, forgot to +1!" [puppet] - ''https://gerrit.wikimedia.org/r/1273785 (https://phabricator.wikimedia.org/T409557) (owner: ''Marostegui)'
2026-04-17 16:09:17 <jinxer-wm> FIRING: [2x] JobUnavailable: Reduced availability for job sidekiq in ops@codfw - https://wikitech.wikimedia.org/wiki/Prometheus#Prometheus_job_unavailable - https://grafana.wikimedia.org/d/NEJu05xZz/prometheus-targets - https://alerts.wikimedia.org/?q=alertname%3DJobUnavailable
2026-04-17 16:12:45 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2218', diff saved to https://phabricator.wikimedia.org/P91102 and previous config saved to /var/cache/conftool/dbconfig/20260417-161245-fceratto.json
2026-04-17 16:15:30 <wikibugs> ('PS9) ''Andrew Bogott: Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598)'
2026-04-17 16:15:30 <wikibugs> ('PS1) ''Andrew Bogott: cloud-vps cloudcontrols: add profile::openstack::base::serverpackages [puppet] - ''https://gerrit.wikimedia.org/r/1273861'
2026-04-17 16:16:34 <wikibugs> ('CR) ''CI reject: [V:''-1] Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598) (owner: ''Andrew Bogott)'
2026-04-17 16:17:27 <wikibugs> ('CR) ''CI reject: [V:''-1] cloud-vps cloudcontrols: add profile::openstack::base::serverpackages [puppet] - ''https://gerrit.wikimedia.org/r/1273861 (owner: ''Andrew Bogott)'
2026-04-17 16:19:23 <wikibugs> ('PS2) ''Andrew Bogott: cloud-vps cloudcontrols: add profile::openstack::base::serverpackages [puppet] - ''https://gerrit.wikimedia.org/r/1273861'
2026-04-17 16:22:47 <wikibugs> ('PS10) ''Andrew Bogott: Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598)'
2026-04-17 16:22:54 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2218 (T419635)', diff saved to https://phabricator.wikimedia.org/P91103 and previous config saved to /var/cache/conftool/dbconfig/20260417-162253-fceratto.json
2026-04-17 16:22:58 <stashbot> T419635: Drop il_to column from imagelinks table in wmf production - https://phabricator.wikimedia.org/T419635
2026-04-17 16:23:00 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 12:00:00 on db2221.codfw.wmnet with reason: Maintenance
2026-04-17 16:23:08 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db2221 (T419635)', diff saved to https://phabricator.wikimedia.org/P91104 and previous config saved to /var/cache/conftool/dbconfig/20260417-162307-fceratto.json
2026-04-17 16:23:15 <wikibugs> ('CR) ''Andrew Bogott: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273861 (owner: ''Andrew Bogott)'
2026-04-17 16:23:48 <wikibugs> ('CR) ''CI reject: [V:''-1] Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598) (owner: ''Andrew Bogott)'
2026-04-17 16:25:19 <wikibugs> 'ops-eqiad, ''SRE, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Repurpose tools-k8s-ctrl[1001-1002],tools-k8s-worker[1001-1008] to wikikube-worker13[73-82] - https://phabricator.wikimedia.org/T423719 (''JMeybohm) ''NEW'
2026-04-17 16:25:21 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2221 (T419635)', diff saved to https://phabricator.wikimedia.org/P91105 and previous config saved to /var/cache/conftool/dbconfig/20260417-162520-fceratto.json
2026-04-17 16:27:57 <wikibugs> 'ops-eqiad, ''SRE, ''DC-Ops: Q2:rack/setup/install Toolforge - https://phabricator.wikimedia.org/T410403#11834146 (''JMeybohm)'
2026-04-17 16:33:09 <wikibugs> ('PS3) ''Andrew Bogott: cloud-vps cloudcontrols: add profile::openstack::base::serverpackages [puppet] - ''https://gerrit.wikimedia.org/r/1273861'
2026-04-17 16:33:09 <wikibugs> ('PS11) ''Andrew Bogott: Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598)'
2026-04-17 16:34:17 <jinxer-wm> RESOLVED: [2x] JobUnavailable: Reduced availability for job sidekiq in ops@codfw - https://wikitech.wikimedia.org/wiki/Prometheus#Prometheus_job_unavailable - https://grafana.wikimedia.org/d/NEJu05xZz/prometheus-targets - https://alerts.wikimedia.org/?q=alertname%3DJobUnavailable
2026-04-17 16:34:38 <wikibugs> ('CR) ''CI reject: [V:''-1] Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598) (owner: ''Andrew Bogott)'
2026-04-17 16:35:29 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2221', diff saved to https://phabricator.wikimedia.org/P91107 and previous config saved to /var/cache/conftool/dbconfig/20260417-163528-fceratto.json
2026-04-17 16:35:55 <wikibugs> ('PS4) ''Andrew Bogott: cloud-vps cloudcontrols: add profile::openstack::base::serverpackages [puppet] - ''https://gerrit.wikimedia.org/r/1273861'
2026-04-17 16:35:55 <wikibugs> ('PS12) ''Andrew Bogott: Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598)'
2026-04-17 16:36:46 <wikibugs> 'SRE, ''Infrastructure-Foundations, ''ServiceOps new, ''ServiceOps-Datastores: Upgrade kafka-logging to version 3.x - https://phabricator.wikimedia.org/T423723 (''herron) ''NEW'
2026-04-17 16:37:01 <wikibugs> ('PS5) ''Andrew Bogott: cloud-vps cloudcontrols: add profile::openstack::base::serverpackages [puppet] - ''https://gerrit.wikimedia.org/r/1273861'
2026-04-17 16:37:01 <wikibugs> ('PS13) ''Andrew Bogott: Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598)'
2026-04-17 16:37:20 <wikibugs> ('CR) ''Andrew Bogott: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273861 (owner: ''Andrew Bogott)'
2026-04-17 16:37:57 <wikibugs> 'SRE, ''Infrastructure-Foundations, ''ServiceOps new, ''ServiceOps-Datastores: Upgrade kafka-logging to version 3.x - https://phabricator.wikimedia.org/T423723#11834206 (''herron) p:''Triage''High'
2026-04-17 16:38:26 <wikibugs> 'SRE, ''Infrastructure-Foundations, ''ServiceOps new, ''ServiceOps-Datastores: Upgrade kafka-logging to version 3.x - https://phabricator.wikimedia.org/T423723#11834210 (''herron)'
2026-04-17 16:38:31 <wikibugs> ('CR) ''CI reject: [V:''-1] Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598) (owner: ''Andrew Bogott)'
2026-04-17 16:38:39 <jinxer-wm> FIRING: [2x] TransitBGPDown: Transit BGP session down between cr3-ulsfo and Hurricane Electric (2001:504:30::ba00:6939:1) - https://wikitech.wikimedia.org/wiki/Network_monitoring#BGP_status - https://alerts.wikimedia.org/?q=alertname%3DTransitBGPDown
2026-04-17 16:39:02 <wikibugs> 'ops-eqsin, ''SRE, ''DC-Ops, ''Infrastructure-Foundations, ''netops: EQSIN:Switch refresh diagram and wiring - https://phabricator.wikimedia.org/T423724 (''Papaul) ''NEW'
2026-04-17 16:39:29 <wikibugs> ('CR) ''CI reject: [V:''-1] cloud-vps cloudcontrols: add profile::openstack::base::serverpackages [puppet] - ''https://gerrit.wikimedia.org/r/1273861 (owner: ''Andrew Bogott)'
2026-04-17 16:39:30 <wikibugs> 'ops-eqiad, ''SRE, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Repurpose tools-k8s-ctrl[1001-1002],tools-k8s-worker[1001-1008] to wikikube-worker13[73-82] - https://phabricator.wikimedia.org/T423719#11834227 (''wiki_willy) Thanks @Clement_Goubert! @VRiley-WMF & @Jclark-ctr - this is the...'
2026-04-17 16:42:10 <wikibugs> 'SRE, ''Infrastructure-Foundations, ''ServiceOps new, ''ServiceOps-Datastores: Upgrade kafka-logging to version 3.x - https://phabricator.wikimedia.org/T423723#11834242 (''herron) @brouberol, do the steps in the description look ok to you, anything I missed?'
2026-04-17 16:42:40 <wikibugs> 'SRE, ''Infrastructure-Foundations, ''ServiceOps new, ''ServiceOps-Datastores: Upgrade kafka-logging to version 3.x - https://phabricator.wikimedia.org/T423723#11834243 (''herron) a:''herron'
2026-04-17 16:43:05 <wikibugs> ('PS6) ''Andrew Bogott: cloud-vps cloudcontrols: add profile::openstack::base::serverpackages [puppet] - ''https://gerrit.wikimedia.org/r/1273861'
2026-04-17 16:43:05 <wikibugs> ('PS14) ''Andrew Bogott: Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598)'
2026-04-17 16:43:23 <jinxer-wm> FIRING: [4x] ProbeDown: Service aqs1010-a:7000 has failed probes (tcp_cassandra_a_ssl_ip4) - https://grafana.wikimedia.org/d/O0nHhdhnz/network-probes-overview?var-job=probes/custom&var-module=All - https://alerts.wikimedia.org/?q=alertname%3DProbeDown
2026-04-17 16:43:37 <wikibugs> ('CR) ''Andrew Bogott: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273861 (owner: ''Andrew Bogott)'
2026-04-17 16:44:29 <wikibugs> ('CR) ''CI reject: [V:''-1] Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598) (owner: ''Andrew Bogott)'
2026-04-17 16:45:37 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2221', diff saved to https://phabricator.wikimedia.org/P91108 and previous config saved to /var/cache/conftool/dbconfig/20260417-164536-fceratto.json
2026-04-17 16:52:13 <wikibugs> 'SRE-swift-storage, ''API Platform, ''Commons, ''MediaWiki-File-management, and 3 others: Commons: UploadChunkFileException: Error storing file: backend-fail-internal; local-swift-codfw - https://phabricator.wikimedia.org/T328872#11834286 (''CDanis) FYI: as of my Puppet patches above, you can now use an x...'
2026-04-17 16:55:45 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2221 (T419635)', diff saved to https://phabricator.wikimedia.org/P91110 and previous config saved to /var/cache/conftool/dbconfig/20260417-165544-fceratto.json
2026-04-17 16:55:49 <stashbot> T419635: Drop il_to column from imagelinks table in wmf production - https://phabricator.wikimedia.org/T419635
2026-04-17 16:55:52 <logmsgbot> !log fceratto@cumin1003 DONE (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 12:00:00 on db2222.codfw.wmnet with reason: Maintenance
2026-04-17 16:56:00 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Depooling db2222 (T419635)', diff saved to https://phabricator.wikimedia.org/P91111 and previous config saved to /var/cache/conftool/dbconfig/20260417-165559-fceratto.json
2026-04-17 16:58:03 <wikibugs> ('PS7) ''Andrew Bogott: cloud-vps cloudcontrols: add profile::openstack::base::serverpackages [puppet] - ''https://gerrit.wikimedia.org/r/1273861'
2026-04-17 16:58:03 <wikibugs> ('PS15) ''Andrew Bogott: Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598)'
2026-04-17 16:58:09 <wikibugs> ('CR) ''Andrew Bogott: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273861 (owner: ''Andrew Bogott)'
2026-04-17 16:58:12 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2222 (T419635)', diff saved to https://phabricator.wikimedia.org/P91112 and previous config saved to /var/cache/conftool/dbconfig/20260417-165811-fceratto.json
2026-04-17 16:58:39 <jinxer-wm> RESOLVED: [2x] TransitBGPDown: Transit BGP session down between cr3-ulsfo and Hurricane Electric (2001:504:30::ba00:6939:1) - https://wikitech.wikimedia.org/wiki/Network_monitoring#BGP_status - https://alerts.wikimedia.org/?q=alertname%3DTransitBGPDown
2026-04-17 16:58:51 <wikibugs> ('CR) ''CI reject: [V:''-1] cloud-vps cloudcontrols: add profile::openstack::base::serverpackages [puppet] - ''https://gerrit.wikimedia.org/r/1273861 (owner: ''Andrew Bogott)'
2026-04-17 17:00:28 <wikibugs> 'ops-codfw, ''SRE, ''collaboration-services, ''DC-Ops: Q3:rack/setup/install phab2003 - https://phabricator.wikimedia.org/T418899#11834314 (''Dzahn) Once the setup issues are resolved we will implement Phabricator and replace phab2002 with it over at T423727.'
2026-04-17 17:03:52 <wikibugs> ('PS1) ''Bking: OpenSearch: Control which plugins we use via systemd PrivateMounts [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860)'
2026-04-17 17:05:00 <wikibugs> 'SRE, ''SRE-Access-Requests, ''Data-Engineering: Requesting access to analytics_privatedata_users and SQL Lab for AnnieKim_WMDE - https://phabricator.wikimedia.org/T420500#11834353 (''Dzahn) ''Resolved''Open a:''Scott_French''None'
2026-04-17 17:05:02 <wikibugs> 'SRE-swift-storage, ''API Platform, ''Commons, ''MediaWiki-File-management, and 3 others: Commons: UploadChunkFileException: Error storing file: backend-fail-internal; local-swift-codfw - https://phabricator.wikimedia.org/T328872#11834355 (''CDanis) BTW -- here are two canned queries for distributed trace...'
2026-04-17 17:05:15 <wikibugs> ('CR) ''Bking: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860) (owner: ''Bking)'
2026-04-17 17:07:30 <icinga-wm> PROBLEM - OSPF status on cr1-magru is CRITICAL: OSPFv2: 1/2 UP : OSPFv3: 1/2 UP https://wikitech.wikimedia.org/wiki/Network_monitoring%23OSPF_status
2026-04-17 17:08:06 <jinxer-wm> FIRING: [2x] CoreRouterInterfaceDown: Core router interface down - cr2-codfw:et-0/1/4 (Transport: cr2-eqiad:et-1/1/5 (Lumen, 449169461) {#3909}) - https://wikitech.wikimedia.org/wiki/Network_monitoring#Router_interface_down - https://alerts.wikimedia.org/?q=alertname%3DCoreRouterInterfaceDown
2026-04-17 17:08:20 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2222', diff saved to https://phabricator.wikimedia.org/P91113 and previous config saved to /var/cache/conftool/dbconfig/20260417-170819-fceratto.json
2026-04-17 17:09:39 <jinxer-wm> FIRING: [2x] TransitBGPDown: Transit BGP session down between cr1-magru and Telxius (2001:1498:1:966:1::251) - https://wikitech.wikimedia.org/wiki/Network_monitoring#BGP_status - https://alerts.wikimedia.org/?q=alertname%3DTransitBGPDown
2026-04-17 17:10:11 <jinxer-wm> FIRING: [2x] BFDdown: BFD session down between cr2-eqiad and 195.200.68.151 - https://wikitech.wikimedia.org/wiki/Network_monitoring#BFD_status - https://grafana.wikimedia.org/d/fb403d62-5f03-434a-9dff-bd02b9fff504/network-device-overview?var-instance=cr2-eqiad:9804 - https://alerts.wikimedia.org/?q=alertname%3DBFDdown
2026-04-17 17:10:19 <wikibugs> ('PS2) ''Bking: OpenSearch: Control which plugins we use via systemd PrivateMounts [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860)'
2026-04-17 17:10:22 <wikibugs> ('CR) ''CDanis: [V:''+1 C:''+1] "Amir or someone, please roll this out in my absence on Monday :D" [puppet] - ''https://gerrit.wikimedia.org/r/1272869 (owner: ''CDanis)'
2026-04-17 17:10:40 <jinxer-wm> FIRING: [4x] CoreBGPDown: Core BGP session down between cr1-magru and cr2-eqiad (195.200.68.150) - group Confed_eqiad - https://wikitech.wikimedia.org/wiki/Network_monitoring#BGP_status - https://alerts.wikimedia.org/?q=alertname%3DCoreBGPDown
2026-04-17 17:10:47 <wikibugs> 'SRE-OnFire: List cookbooks on wikitech - https://phabricator.wikimedia.org/T423730 (''jijiki) ''NEW'
2026-04-17 17:10:49 <wikibugs> ('PS1) ''Dzahn: etherpad: update warning message about truncation to end of May [puppet] - ''https://gerrit.wikimedia.org/r/1273889 (https://phabricator.wikimedia.org/T415237)'
2026-04-17 17:11:21 <wikibugs> ('CR) ''Pppery: etherpad: update warning message about truncation to end of May (''1 comment) [puppet] - ''https://gerrit.wikimedia.org/r/1273889 (https://phabricator.wikimedia.org/T415237) (owner: ''Dzahn)'
2026-04-17 17:11:34 <wikibugs> ('CR) ''Dzahn: [C:''+2] etherpad: update warning message about truncation to end of May [puppet] - ''https://gerrit.wikimedia.org/r/1273889 (https://phabricator.wikimedia.org/T415237) (owner: ''Dzahn)'
2026-04-17 17:11:54 <wikibugs> ('PS3) ''Bking: OpenSearch: Control which plugins we use via systemd PrivateMounts [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860)'
2026-04-17 17:12:00 <wikibugs> ('CR) ''Bking: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860) (owner: ''Bking)'
2026-04-17 17:12:12 <wikibugs> ('PS2) ''Dzahn: etherpad: update warning message about truncation to end of May [puppet] - ''https://gerrit.wikimedia.org/r/1273889 (https://phabricator.wikimedia.org/T415237)'
2026-04-17 17:12:18 <wikibugs> ('CR) ''Dzahn: etherpad: update warning message about truncation to end of May (''1 comment) [puppet] - ''https://gerrit.wikimedia.org/r/1273889 (https://phabricator.wikimedia.org/T415237) (owner: ''Dzahn)'
2026-04-17 17:13:00 <wikibugs> ('CR) ''Dzahn: [C:''+2] etherpad: update warning message about truncation to end of May [puppet] - ''https://gerrit.wikimedia.org/r/1273889 (https://phabricator.wikimedia.org/T415237) (owner: ''Dzahn)'
2026-04-17 17:14:19 <wikibugs> ('PS8) ''Andrew Bogott: cloud-vps cloudcontrols: add profile::openstack::base::serverpackages [puppet] - ''https://gerrit.wikimedia.org/r/1273861'
2026-04-17 17:14:35 <wikibugs> ('CR) ''Andrew Bogott: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598) (owner: ''Andrew Bogott)'
2026-04-17 17:14:39 <jinxer-wm> FIRING: [4x] TransitBGPDown: Transit BGP session down between cr1-magru and Telxius (2001:1498:1:966:1::251) - https://wikitech.wikimedia.org/wiki/Network_monitoring#BGP_status - https://alerts.wikimedia.org/?q=alertname%3DTransitBGPDown
2026-04-17 17:16:21 <wikibugs> 'SRE-SLO, ''ServiceOps new, ''Data-Platform-SRE (2026-03-27 - 2026-04-17), ''Essential-Work, and 2 others: IPoid: Define service level indicators and service level objectives - https://phabricator.wikimedia.org/T348935#11834387 (''BTullis) I have drafted some SLI definitions here: https://wikitech.wikimed...'
2026-04-17 17:18:28 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2222', diff saved to https://phabricator.wikimedia.org/P91114 and previous config saved to /var/cache/conftool/dbconfig/20260417-171827-fceratto.json
2026-04-17 17:24:11 <wikibugs> ('PS4) ''Bking: OpenSearch: Control which plugins we use via systemd PrivateMounts [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860)'
2026-04-17 17:25:05 <wikibugs> 'SRE-SLO, ''ServiceOps new, ''Data-Platform-SRE (2026-03-27 - 2026-04-17), ''Essential-Work, and 2 others: IPoid: Define service level indicators and service level objectives - https://phabricator.wikimedia.org/T348935#11834420 (''BTullis) It's worth noting that when I started working on the latency indic...'
2026-04-17 17:25:06 <wikibugs> ('CR) ''Bking: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860) (owner: ''Bking)'
2026-04-17 17:28:36 <logmsgbot> !log fceratto@cumin1003 dbctl commit (dc=all): 'Repooling after maintenance db2222 (T419635)', diff saved to https://phabricator.wikimedia.org/P91116 and previous config saved to /var/cache/conftool/dbconfig/20260417-172835-fceratto.json
2026-04-17 17:28:40 <stashbot> T419635: Drop il_to column from imagelinks table in wmf production - https://phabricator.wikimedia.org/T419635
2026-04-17 17:28:49 <wikibugs> 'SRE-SLO, ''ServiceOps new, ''Data-Platform-SRE (2026-03-27 - 2026-04-17), ''Essential-Work, and 2 others: IPoid: Define service level indicators and service level objectives - https://phabricator.wikimedia.org/T348935#11834430 (''BTullis) There are also some draft SLOs here: https://wikitech.wikimedia.or...'
2026-04-17 17:32:26 <wikibugs> ('PS9) ''Andrew Bogott: cloud-vps cloudcontrols: add profile::openstack::base::serverpackages [puppet] - ''https://gerrit.wikimedia.org/r/1273861'
2026-04-17 17:32:26 <wikibugs> ('PS16) ''Andrew Bogott: Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598)'
2026-04-17 17:34:02 <wikibugs> ('PS5) ''Bking: OpenSearch: Control which plugins we use via systemd PrivateMounts [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860)'
2026-04-17 17:34:27 <wikibugs> 'SRE, ''Infrastructure-Foundations, ''ServiceOps new, ''ServiceOps-Datastores, ''Patch-For-Review: Upgrade kafka-logging to version 3.x - https://phabricator.wikimedia.org/T423723#11834455 (''brouberol) cc @elukey as he was the one working on the puppet side of things. It //does// look good to me though!'
2026-04-17 17:34:28 <wikibugs> ('PS10) ''Andrew Bogott: cloud-vps: consolidate inclusion of openstack server/client packages [puppet] - ''https://gerrit.wikimedia.org/r/1273861'
2026-04-17 17:34:28 <wikibugs> ('PS17) ''Andrew Bogott: Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598)'
2026-04-17 17:34:44 <wikibugs> ('CR) ''Bking: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860) (owner: ''Bking)'
2026-04-17 17:35:51 <wikibugs> ('CR) ''CI reject: [V:''-1] cloud-vps: consolidate inclusion of openstack server/client packages [puppet] - ''https://gerrit.wikimedia.org/r/1273861 (owner: ''Andrew Bogott)'
2026-04-17 17:36:02 <wikibugs> ('PS1) ''Dzahn: etherpad: insert a warning message into the index HTML [puppet] - ''https://gerrit.wikimedia.org/r/1273902 (https://phabricator.wikimedia.org/T420793)'
2026-04-17 17:36:35 <wikibugs> ('CR) ''CI reject: [V:''-1] etherpad: insert a warning message into the index HTML [puppet] - ''https://gerrit.wikimedia.org/r/1273902 (https://phabricator.wikimedia.org/T420793) (owner: ''Dzahn)'
2026-04-17 17:36:49 <wikibugs> ('CR) ''Dzahn: "using some parts of the message we also use in new pad messages" [puppet] - ''https://gerrit.wikimedia.org/r/1273902 (https://phabricator.wikimedia.org/T420793) (owner: ''Dzahn)'
2026-04-17 17:37:13 <wikibugs> ('CR) ''Andrew Bogott: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273861 (owner: ''Andrew Bogott)'
2026-04-17 17:37:22 <wikibugs> ('CR) ''Andrew Bogott: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598) (owner: ''Andrew Bogott)'
2026-04-17 17:37:36 <wikibugs> ('PS2) ''Dzahn: etherpad: insert a warning message into the index HTML [puppet] - ''https://gerrit.wikimedia.org/r/1273902 (https://phabricator.wikimedia.org/T420793)'
2026-04-17 17:40:40 <wikibugs> ('CR) ''Pppery: "I would stick a "Bug: T371591" link on this commit, as this finally does what that task actually requested." [puppet] - ''https://gerrit.wikimedia.org/r/1273902 (https://phabricator.wikimedia.org/T420793) (owner: ''Dzahn)'
2026-04-17 17:42:35 <wikibugs> ('PS3) ''Dzahn: etherpad: insert a warning message into the index HTML [puppet] - ''https://gerrit.wikimedia.org/r/1273902 (https://phabricator.wikimedia.org/T420793)'
2026-04-17 17:42:50 <wikibugs> ('CR) ''Dzahn: "ah, thanks! doing!" [puppet] - ''https://gerrit.wikimedia.org/r/1273902 (https://phabricator.wikimedia.org/T420793) (owner: ''Dzahn)'
2026-04-17 17:43:06 <wikibugs> ('CR) ''Pppery: "Also maybe stick a link to https://meta.wikimedia.org/wiki/Etherpad somewhere in the content somewhere. Otherwise looks good to me as far " [puppet] - ''https://gerrit.wikimedia.org/r/1273902 (https://phabricator.wikimedia.org/T420793) (owner: ''Dzahn)'
2026-04-17 17:43:23 <wikibugs> ('CR) ''Dzahn: [V:''+1] "https://puppet-compiler.wmflabs.org/output/1273902/8439/etherpad1004.eqiad.wmnet/index.html"; [puppet] - ''https://gerrit.wikimedia.org/r/1273902 (https://phabricator.wikimedia.org/T420793) (owner: ''Dzahn)'
2026-04-17 17:46:28 <wikibugs> ('CR) ''Dzahn: [V:''+1] "Ok. done! linked "WMF Etherpad" to the URL above." [puppet] - ''https://gerrit.wikimedia.org/r/1273902 (https://phabricator.wikimedia.org/T420793) (owner: ''Dzahn)'
2026-04-17 17:46:53 <wikibugs> ('PS4) ''Dzahn: etherpad: insert a warning message into the index HTML [puppet] - ''https://gerrit.wikimedia.org/r/1273902 (https://phabricator.wikimedia.org/T420793)'
2026-04-17 17:47:29 <wikibugs> ('CR) ''Pppery: [C:''+1] etherpad: insert a warning message into the index HTML [puppet] - ''https://gerrit.wikimedia.org/r/1273902 (https://phabricator.wikimedia.org/T420793) (owner: ''Dzahn)'
2026-04-17 17:47:42 <wikibugs> ('CR) ''Pppery: [C:''+1] "This got lost in PS4" [puppet] - ''https://gerrit.wikimedia.org/r/1273902 (https://phabricator.wikimedia.org/T420793) (owner: ''Dzahn)'
2026-04-17 17:48:04 <wikibugs> ('CR) ''Dzahn: [C:''+2] etherpad: insert a warning message into the index HTML [puppet] - ''https://gerrit.wikimedia.org/r/1273902 (https://phabricator.wikimedia.org/T420793) (owner: ''Dzahn)'
2026-04-17 17:49:27 <wikibugs> ('CR) ''Jdlrobson: [C:''+1] Enable ReadingLists beta feature for all Wikipedia wikis [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1273842 (https://phabricator.wikimedia.org/T420881) (owner: ''Aude)'
2026-04-17 17:49:39 <wikibugs> ('PS5) ''Dzahn: etherpad: insert a warning message into the index HTML [puppet] - ''https://gerrit.wikimedia.org/r/1273902 (https://phabricator.wikimedia.org/T420793)'
2026-04-17 17:49:52 <wikibugs> ('PS6) ''Dzahn: etherpad: insert a warning message into the index HTML [puppet] - ''https://gerrit.wikimedia.org/r/1273902 (https://phabricator.wikimedia.org/T420793)'
2026-04-17 17:52:42 <wikibugs> ('PS6) ''Bking: OpenSearch: Control which plugins we use via systemd PrivateMounts [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860)'
2026-04-17 17:52:59 <wikibugs> ('CR) ''Bking: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860) (owner: ''Bking)'
2026-04-17 17:53:13 <wikibugs> ('CR) ''CI reject: [V:''-1] OpenSearch: Control which plugins we use via systemd PrivateMounts [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860) (owner: ''Bking)'
2026-04-17 17:55:42 <wikibugs> ('CR) ''Dzahn: [C:''+2] etherpad: insert a warning message into the index HTML [puppet] - ''https://gerrit.wikimedia.org/r/1273902 (https://phabricator.wikimedia.org/T420793) (owner: ''Dzahn)'
2026-04-17 17:59:03 <wikibugs> ('PS1) ''CDanis: mwscript-k8s: add --output-file flag [puppet] - ''https://gerrit.wikimedia.org/r/1273905'
2026-04-17 18:45:55 <wikibugs> ('CR) ''Dzahn: [C:''+1] gerrit: migrate data gerrit1003 to /srv/gerrit [puppet] - ''https://gerrit.wikimedia.org/r/1273449 (https://phabricator.wikimedia.org/T333143) (owner: ''Jelto)'
2026-04-17 18:47:57 <wikibugs> ('CR) ''Dzahn: gerrit: update sync-instances cookbook (''1 comment) [cookbooks] - ''https://gerrit.wikimedia.org/r/1270863 (https://phabricator.wikimedia.org/T333143) (owner: ''Arnaudb)'
2026-04-17 18:51:42 <wikibugs> ('CR) ''Dzahn: [C:''+1] "+1 as long as things happen in the right order" [puppet] - ''https://gerrit.wikimedia.org/r/1270774 (https://phabricator.wikimedia.org/T423027) (owner: ''Arnaudb)'
2026-04-17 18:52:34 <wikibugs> ('PS7) ''Bking: OpenSearch: Control which plugins we use via systemd PrivateMounts [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860)'
2026-04-17 18:53:30 <wikibugs> ('CR) ''Bking: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860) (owner: ''Bking)'
2026-04-17 18:54:35 <wikibugs> ('CR) ''CI reject: [V:''-1] OpenSearch: Control which plugins we use via systemd PrivateMounts [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860) (owner: ''Bking)'
2026-04-17 18:55:31 <wikibugs> ('PS8) ''Bking: OpenSearch: Control which plugins we use via systemd PrivateMounts [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860)'
2026-04-17 18:57:25 <wikibugs> ('PS11) ''Andrew Bogott: cloud-vps: consolidate inclusion of openstack server/client packages [puppet] - ''https://gerrit.wikimedia.org/r/1273861'
2026-04-17 18:57:25 <wikibugs> ('PS18) ''Andrew Bogott: Openstack: use debian.net repo rather than the wmf-hosted repo [puppet] - ''https://gerrit.wikimedia.org/r/1272837 (https://phabricator.wikimedia.org/T423598)'
2026-04-17 18:57:39 <wikibugs> ('CR) ''CI reject: [V:''-1] OpenSearch: Control which plugins we use via systemd PrivateMounts [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860) (owner: ''Bking)'
2026-04-17 18:58:36 <wikibugs> ('PS9) ''Bking: OpenSearch: Control which plugins we use via systemd PrivateMounts [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860)'
2026-04-17 18:59:28 <wikibugs> ('CR) ''CI reject: [V:''-1] OpenSearch: Control which plugins we use via systemd PrivateMounts [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860) (owner: ''Bking)'
2026-04-17 19:02:11 <wikibugs> ('PS10) ''Bking: OpenSearch: Control which plugins we use via systemd PrivateMounts [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860)'
2026-04-17 19:02:18 <wikibugs> ('CR) ''Bking: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860) (owner: ''Bking)'
2026-04-17 19:04:06 <wikibugs> ('CR) ''Dzahn: [C:''+2] jenkins: allow disabling jenkins even on the manager host [puppet] - ''https://gerrit.wikimedia.org/r/1271017 (https://phabricator.wikimedia.org/T418109) (owner: ''Dzahn)'
2026-04-17 19:05:11 <jinxer-wm> FIRING: [3x] BFDdown: BFD session down between cr1-eqiad and fe80::7a4f:9b00:d4e:7c0c - https://wikitech.wikimedia.org/wiki/Network_monitoring#BFD_status - https://alerts.wikimedia.org/?q=alertname%3DBFDdown
2026-04-17 19:09:27 <wikibugs> ('CR) ''Dzahn: [C:''+2] "complete noop on all contint* servers - but allows disabling jenkins on legacy hosts" [puppet] - ''https://gerrit.wikimedia.org/r/1271017 (https://phabricator.wikimedia.org/T418109) (owner: ''Dzahn)'
2026-04-17 19:11:48 <wikibugs> ('PS1) ''Dzahn: contint: disable jenkins on legacy CI hosts [puppet] - ''https://gerrit.wikimedia.org/r/1273919 (https://phabricator.wikimedia.org/T418109)'
2026-04-17 19:12:28 <wikibugs> ('PS11) ''Bking: OpenSearch: Control which plugins we use via systemd PrivateMounts [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860)'
2026-04-17 19:12:41 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.dns.netbox
2026-04-17 19:13:40 <wikibugs> ('CR) ''Bking: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860) (owner: ''Bking)'
2026-04-17 19:14:10 <wikibugs> ('PS1) ''CDobbins: data.yaml: remove legacy ssh key; add fido backup [puppet] - ''https://gerrit.wikimedia.org/r/1273925'
2026-04-17 19:15:38 <wikibugs> ('CR) ''Dzahn: [V:''+1] "https://puppet-compiler.wmflabs.org/output/1273919/8441/"; [puppet] - ''https://gerrit.wikimedia.org/r/1273919 (https://phabricator.wikimedia.org/T418109) (owner: ''Dzahn)'
2026-04-17 19:16:02 <wikibugs> ('PS7) ''CDanis: fundraising_data_import maintenance script wrapper & timer [puppet] - ''https://gerrit.wikimedia.org/r/1271028 (https://phabricator.wikimedia.org/T416948)'
2026-04-17 19:16:02 <wikibugs> ('PS1) ''CDanis: kubeadm: add kubectl wait-job plugin [puppet] - ''https://gerrit.wikimedia.org/r/1273926'
2026-04-17 19:16:45 <wikibugs> ('CR) ''CDobbins: [C:''+2] data.yaml: remove legacy ssh key; add fido backup [puppet] - ''https://gerrit.wikimedia.org/r/1273925 (owner: ''CDobbins)'
2026-04-17 19:16:55 <wikibugs> ('CR) ''CDanis: "This is admittedly untested (too many prereq patches in this stack), but should work :)" [puppet] - ''https://gerrit.wikimedia.org/r/1271028 (https://phabricator.wikimedia.org/T416948) (owner: ''CDanis)'
2026-04-17 19:17:17 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.dns.netbox: adding phab1006 to eqiad - jclark@cumin1003"
2026-04-17 19:17:23 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.dns.netbox: adding phab1006 to eqiad - jclark@cumin1003"
2026-04-17 19:17:23 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.dns.netbox (exit_code=0)
2026-04-17 19:17:36 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.dns.netbox
2026-04-17 19:18:25 <wikibugs> ('CR) ''CI reject: [V:''-1] fundraising_data_import maintenance script wrapper & timer [puppet] - ''https://gerrit.wikimedia.org/r/1271028 (https://phabricator.wikimedia.org/T416948) (owner: ''CDanis)'
2026-04-17 19:18:43 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1072.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:19:02 <icinga-wm> PROBLEM - OSPF status on cr1-eqiad is CRITICAL: OSPFv2: 3/5 UP : OSPFv3: 3/5 UP https://wikitech.wikimedia.org/wiki/Network_monitoring%23OSPF_status
2026-04-17 19:19:08 <icinga-wm> PROBLEM - OSPF status on cr2-eqdfw is CRITICAL: OSPFv2: 5/7 UP : OSPFv3: 4/7 UP https://wikitech.wikimedia.org/wiki/Network_monitoring%23OSPF_status
2026-04-17 19:19:30 <icinga-wm> PROBLEM - OSPF status on cr2-esams is CRITICAL: OSPFv2: 1/3 UP : OSPFv3: 2/3 UP https://wikitech.wikimedia.org/wiki/Network_monitoring%23OSPF_status
2026-04-17 19:19:58 <icinga-wm> RECOVERY - OSPF status on cr1-eqiad is OK: OSPFv2: 5/5 UP : OSPFv3: 5/5 UP https://wikitech.wikimedia.org/wiki/Network_monitoring%23OSPF_status
2026-04-17 19:20:08 <icinga-wm> RECOVERY - OSPF status on cr2-eqdfw is OK: OSPFv2: 7/7 UP : OSPFv3: 7/7 UP https://wikitech.wikimedia.org/wiki/Network_monitoring%23OSPF_status
2026-04-17 19:20:11 <jinxer-wm> FIRING: [4x] BFDdown: BFD session down between cr1-eqiad and fe80::7a4f:9b00:d4e:7c0c - https://wikitech.wikimedia.org/wiki/Network_monitoring#BFD_status - https://alerts.wikimedia.org/?q=alertname%3DBFDdown
2026-04-17 19:20:30 <icinga-wm> RECOVERY - OSPF status on cr2-esams is OK: OSPFv2: 3/3 UP : OSPFv3: 3/3 UP https://wikitech.wikimedia.org/wiki/Network_monitoring%23OSPF_status
2026-04-17 19:20:40 <jinxer-wm> FIRING: [7x] CoreBGPDown: Core BGP session down between cr1-eqiad and cr2-esams (185.15.59.145) - group Confed_esams - https://wikitech.wikimedia.org/wiki/Network_monitoring#BGP_status - https://alerts.wikimedia.org/?q=alertname%3DCoreBGPDown
2026-04-17 19:21:11 <wikibugs> ('CR) ''Dzahn: [V:''+1] "https://puppet-compiler.wmflabs.org/output/1270580/8442/zuul1001.eqiad.wmnet/index.html"; [puppet] - ''https://gerrit.wikimedia.org/r/1270580 (https://phabricator.wikimedia.org/T422895) (owner: ''Dzahn)'
2026-04-17 19:21:26 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1071.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:21:27 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.dns.netbox: adding phab1006 to eqiad - jclark@cumin1003"
2026-04-17 19:21:33 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.dns.netbox: adding phab1006 to eqiad - jclark@cumin1003"
2026-04-17 19:21:33 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.dns.netbox (exit_code=0)
2026-04-17 19:21:40 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1070.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:21:48 <wikibugs> ('PS8) ''CDanis: fundraising_data_import maintenance script wrapper & timer [puppet] - ''https://gerrit.wikimedia.org/r/1271028 (https://phabricator.wikimedia.org/T416948)'
2026-04-17 19:22:01 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1069.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:22:07 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1068.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:22:18 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1067.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:22:34 <wikibugs> ('CR) ''Bking: [C:''+2] "self-merging, as PCC suggests only the test server will be affected." [puppet] - ''https://gerrit.wikimedia.org/r/1273887 (https://phabricator.wikimedia.org/T422860) (owner: ''Bking)'
2026-04-17 19:23:28 <wikibugs> ('CR) ''Dduvall: "So smart! 😊" [puppet] - ''https://gerrit.wikimedia.org/r/1272970 (https://phabricator.wikimedia.org/T406384) (owner: ''Dduvall)'
2026-04-17 19:24:41 <logmsgbot> !log jclark@cumin1003 END (FAIL) - Cookbook sre.hosts.provision (exit_code=99) for host mc1072.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:25:11 <jinxer-wm> FIRING: [5x] BFDdown: BFD session down between cr1-eqiad and fe80::ee38:7300:ce8:9c56 - https://wikitech.wikimedia.org/wiki/Network_monitoring#BFD_status - https://alerts.wikimedia.org/?q=alertname%3DBFDdown
2026-04-17 19:25:30 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1066.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:25:40 <jinxer-wm> FIRING: [8x] CoreBGPDown: Core BGP session down between cr1-eqiad and cr2-esams (185.15.59.145) - group Confed_esams - https://wikitech.wikimedia.org/wiki/Network_monitoring#BGP_status - https://alerts.wikimedia.org/?q=alertname%3DCoreBGPDown
2026-04-17 19:25:59 <jinxer-wm> FIRING: KubernetesDeploymentUnavailableReplicas: ...
2026-04-17 19:25:59 <jinxer-wm> Deployment linkrecommendation-internal in linkrecommendation at eqiad has persistently unavailable replicas - https://wikitech.wikimedia.org/wiki/Kubernetes/Troubleshooting#Troubleshooting_a_deployment - https://grafana.wikimedia.org/d/a260da06-259a-4ee4-9540-5cab01a246c8/kubernetes-deployment-details?var-site=eqiad&var-cluster=k8s&var-namespace=linkrecommendation&var-deployment=linkrecommendation-internal - ...
2026-04-17 19:25:59 <jinxer-wm> https://alerts.wikimedia.org/?q=alertname%3DKubernetesDeploymentUnavailableReplicas
2026-04-17 19:28:04 <wikibugs> ('CR) ''Dzahn: [V:''+1 C:''+2] zuul: make gerrit ssh key configurable in Hiera and add it [puppet] - ''https://gerrit.wikimedia.org/r/1270580 (https://phabricator.wikimedia.org/T422895) (owner: ''Dzahn)'
2026-04-17 19:32:14 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1071.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:32:53 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1069.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:32:59 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] START helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich-next: apply
2026-04-17 19:33:01 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1070.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:33:03 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] DONE helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich-next: apply
2026-04-17 19:33:07 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1068.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:33:12 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1067.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:33:22 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1064.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:33:24 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1063.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:33:28 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1065.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:33:37 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1062.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:35:04 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1061.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:35:11 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1059.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:35:30 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1060.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:35:32 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1058.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:36:12 <logmsgbot> !log jclark@cumin1003 END (FAIL) - Cookbook sre.hosts.provision (exit_code=99) for host mc1058.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:36:26 <wikibugs> ('CR) ''Dzahn: [V:''+1 C:''+2] "The error message we wanted to see. No more other problems and the key is there - it just has not been added on the Gerrit side: "paramiko" [puppet] - ''https://gerrit.wikimedia.org/r/1270580 (https://phabricator.wikimedia.org/T422895) (owner: ''Dzahn)'
2026-04-17 19:36:42 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1066.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:36:43 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1057.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:37:02 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1058.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:37:26 <logmsgbot> !log jclark@cumin1003 END (FAIL) - Cookbook sre.hosts.provision (exit_code=99) for host mc1058.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:37:47 <wikibugs> ('PS1) ''Bking: opensearch: move var up so we can use it earlier [puppet] - ''https://gerrit.wikimedia.org/r/1273937 (https://phabricator.wikimedia.org/T422860)'
2026-04-17 19:38:21 <wikibugs> ('CR) ''Bking: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1273937 (https://phabricator.wikimedia.org/T422860) (owner: ''Bking)'
2026-04-17 19:38:43 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1056.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:40:56 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1063.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:41:15 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1055.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:42:03 <wikibugs> ('CR) ''Bking: [C:''+2] opensearch: move var up so we can use it earlier [puppet] - ''https://gerrit.wikimedia.org/r/1273937 (https://phabricator.wikimedia.org/T422860) (owner: ''Bking)'
2026-04-17 19:44:15 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1064.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:44:25 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1065.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:44:32 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1062.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:46:08 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1061.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:47:21 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1059.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:48:11 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1058.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:48:44 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1057.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:49:04 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1060.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:49:31 <wikibugs> ('PS2) ''CDanis: deployment_server: add kubectl wait-job plugin [puppet] - ''https://gerrit.wikimedia.org/r/1273926'
2026-04-17 19:49:31 <wikibugs> ('PS9) ''CDanis: fundraising_data_import maintenance script wrapper & timer [puppet] - ''https://gerrit.wikimedia.org/r/1271028 (https://phabricator.wikimedia.org/T416948)'
2026-04-17 19:50:35 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1056.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:50:40 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1060.eqiad.wmnet with OS bookworm
2026-04-17 19:50:45 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834773 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1060.eqiad.wmnet with OS bookworm'
2026-04-17 19:53:31 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1055.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 19:55:17 <wikibugs> ('PS1) ''Bking: cloudelastic1012: remove the deliberately-introduced typo [puppet] - ''https://gerrit.wikimedia.org/r/1273943 (https://phabricator.wikimedia.org/T423327)'
2026-04-17 19:57:20 <wikibugs> ('CR) ''Bking: [C:''+2] cloudelastic1012: remove the deliberately-introduced typo [puppet] - ''https://gerrit.wikimedia.org/r/1273943 (https://phabricator.wikimedia.org/T423327) (owner: ''Bking)'
2026-04-17 19:59:04 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1058.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 20:03:24 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1055.eqiad.wmnet with OS bookworm
2026-04-17 20:03:35 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834789 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1055.eqiad.wmnet with OS bookworm'
2026-04-17 20:03:47 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1056.eqiad.wmnet with OS bookworm
2026-04-17 20:03:52 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834790 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1056.eqiad.wmnet with OS bookworm'
2026-04-17 20:04:08 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1057.eqiad.wmnet with OS bookworm
2026-04-17 20:04:13 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834791 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1057.eqiad.wmnet with OS bookworm'
2026-04-17 20:06:12 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1060.eqiad.wmnet with reason: host reimage
2026-04-17 20:08:30 <jinxer-wm> FIRING: Outbound discards: Alert for device asw2-b-eqiad.mgmt.eqiad.wmnet - Outbound discards - https://alerts.wikimedia.org/?q=alertname%3DOutbound+discards
2026-04-17 20:09:11 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1059.eqiad.wmnet with OS bookworm
2026-04-17 20:09:15 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1064.eqiad.wmnet with OS bookworm
2026-04-17 20:09:17 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834792 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1059.eqiad.wmnet with OS bookworm'
2026-04-17 20:09:20 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834793 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1064.eqiad.wmnet with OS bookworm'
2026-04-17 20:10:21 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1061.eqiad.wmnet with OS bookworm
2026-04-17 20:10:29 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1060.eqiad.wmnet with reason: host reimage
2026-04-17 20:10:30 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1062.eqiad.wmnet with OS bookworm
2026-04-17 20:10:32 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834794 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1061.eqiad.wmnet with OS bookworm'
2026-04-17 20:10:35 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834795 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1062.eqiad.wmnet with OS bookworm'
2026-04-17 20:13:21 <mutante> !log planet1003, planet2003 - rebooting on ganeti level for T422596
2026-04-17 20:13:25 <stashbot> Logged the message at https://wikitech.wikimedia.org/wiki/Server_Admin_Log
2026-04-17 20:13:25 <stashbot> T422596: Failing Trixie VM installations on routed Ganeti - https://phabricator.wikimedia.org/T422596
2026-04-17 20:14:16 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1055.eqiad.wmnet with reason: host reimage
2026-04-17 20:14:57 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1057.eqiad.wmnet with reason: host reimage
2026-04-17 20:15:08 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.dns.netbox
2026-04-17 20:17:23 <logmsgbot> !log jhancock@cumin2002 END (FAIL) - Cookbook sre.dns.netbox (exit_code=99)
2026-04-17 20:17:28 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.dns.netbox
2026-04-17 20:20:09 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1064.eqiad.wmnet with reason: host reimage
2026-04-17 20:20:12 <wikibugs> 'SRE, ''Infrastructure-Foundations: Failing Trixie VM installations on routed Ganeti - https://phabricator.wikimedia.org/T422596#11834804 (''Dzahn) I did: ` [ganeti1046:~] $ sudo gnt-instance modify -B memory=2G planet1003.eqiad.wmnet .. [ganeti1046:~] $ sudo gnt-instance reboot planet1003.eqiad.wmnet .....'
2026-04-17 20:20:13 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1059.eqiad.wmnet with reason: host reimage
2026-04-17 20:20:19 <wikibugs> ('PS10) ''Kamila Součková: mw-web: Remove the hard-coded k8s version [deployment-charts] - ''https://gerrit.wikimedia.org/r/1201804 (https://phabricator.wikimedia.org/T388969)'
2026-04-17 20:20:19 <wikibugs> ('PS1) ''Kamila Součková: Remove k8s version from all services [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273967 (https://phabricator.wikimedia.org/T388969)'
2026-04-17 20:20:30 <wikibugs> 'SRE, ''collaboration-services, ''Infrastructure-Foundations: Failing Trixie VM installations on routed Ganeti - https://phabricator.wikimedia.org/T422596#11834806 (''Dzahn)'
2026-04-17 20:20:49 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1055.eqiad.wmnet with reason: host reimage
2026-04-17 20:20:54 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1061.eqiad.wmnet with reason: host reimage
2026-04-17 20:21:14 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1062.eqiad.wmnet with reason: host reimage
2026-04-17 20:21:51 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.dns.netbox: adding db2250 to codfw - jhancock@cumin2002"
2026-04-17 20:21:56 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.dns.netbox: adding db2250 to codfw - jhancock@cumin2002"
2026-04-17 20:21:56 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.dns.netbox (exit_code=0)
2026-04-17 20:22:07 <wikibugs> ('CR) ''CI reject: [V:''-1] mw-web: Remove the hard-coded k8s version [deployment-charts] - ''https://gerrit.wikimedia.org/r/1201804 (https://phabricator.wikimedia.org/T388969) (owner: ''Kamila Součková)'
2026-04-17 20:22:13 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.network.configure-switch-interfaces for host db2250
2026-04-17 20:22:17 <wikibugs> ('CR) ''CI reject: [V:''-1] Remove k8s version from all services [deployment-charts] - ''https://gerrit.wikimedia.org/r/1273967 (https://phabricator.wikimedia.org/T388969) (owner: ''Kamila Součková)'
2026-04-17 20:22:34 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.network.configure-switch-interfaces (exit_code=0) for host db2250
2026-04-17 20:22:37 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.network.configure-switch-interfaces for host db2251
2026-04-17 20:22:46 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.network.configure-switch-interfaces (exit_code=0) for host db2251
2026-04-17 20:22:57 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.network.configure-switch-interfaces for host db2252
2026-04-17 20:23:06 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.network.configure-switch-interfaces (exit_code=0) for host db2252
2026-04-17 20:23:10 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.network.configure-switch-interfaces for host db2253
2026-04-17 20:23:19 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.network.configure-switch-interfaces (exit_code=0) for host db2253
2026-04-17 20:24:44 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1064.eqiad.wmnet with reason: host reimage
2026-04-17 20:25:13 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.dns.netbox
2026-04-17 20:25:26 <wikibugs> ('PS2) ''Dzahn: ci: switch jenkins proxy target to new discovery name [puppet] - ''https://gerrit.wikimedia.org/r/1254308 (https://phabricator.wikimedia.org/T418521)'
2026-04-17 20:28:01 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 20:28:33 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 20:28:34 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1060.eqiad.wmnet with OS bookworm
2026-04-17 20:28:39 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834825 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1060.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 20:28:44 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1061.eqiad.wmnet with reason: host reimage
2026-04-17 20:28:49 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1063.eqiad.wmnet with OS bookworm
2026-04-17 20:28:56 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834826 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1063.eqiad.wmnet with OS bookworm'
2026-04-17 20:29:01 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1058.eqiad.wmnet with OS bookworm
2026-04-17 20:29:05 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834827 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1058.eqiad.wmnet with OS bookworm'
2026-04-17 20:29:53 <wikibugs> ('CR) ''Kamila Součková: "OF COURSE SOMEBODY MERGES A COMPLETELY UNRELATED CHANGE THAT BREAKS CI THE MOMENT I FINALLY GET THIS MONTHS OLD THING TO NOT BREAK CI XD" [deployment-charts] - ''https://gerrit.wikimedia.org/r/1201804 (https://phabricator.wikimedia.org/T388969) (owner: ''Kamila Součková)'
2026-04-17 20:30:25 <jinxer-wm> FIRING: SystemdUnitFailed: check_netbox_uncommitted_dns_changes.service on netbox1003:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 20:31:36 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.dns.netbox: adding pc2021 to codfw - jhancock@cumin2002"
2026-04-17 20:31:41 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.dns.netbox: adding pc2021 to codfw - jhancock@cumin2002"
2026-04-17 20:31:42 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.dns.netbox (exit_code=0)
2026-04-17 20:31:48 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1065.eqiad.wmnet with OS bookworm
2026-04-17 20:31:53 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834837 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1065.eqiad.wmnet with OS bookworm'
2026-04-17 20:32:09 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1062.eqiad.wmnet with reason: host reimage
2026-04-17 20:33:56 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.network.configure-switch-interfaces for host pc2021
2026-04-17 20:34:06 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.network.configure-switch-interfaces (exit_code=0) for host pc2021
2026-04-17 20:34:09 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.network.configure-switch-interfaces for host pc2022
2026-04-17 20:34:23 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.network.configure-switch-interfaces (exit_code=0) for host pc2022
2026-04-17 20:34:26 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.network.configure-switch-interfaces for host pc2023
2026-04-17 20:34:36 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.network.configure-switch-interfaces (exit_code=0) for host pc2023
2026-04-17 20:34:54 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.network.configure-switch-interfaces for host pc2024
2026-04-17 20:35:04 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.network.configure-switch-interfaces (exit_code=0) for host pc2024
2026-04-17 20:35:25 <jinxer-wm> RESOLVED: SystemdUnitFailed: check_netbox_uncommitted_dns_changes.service on netbox1003:9100 - https://wikitech.wikimedia.org/wiki/Monitoring/check_systemd_state - https://grafana.wikimedia.org/d/g-AaZRFWk/systemd-status - https://alerts.wikimedia.org/?q=alertname%3DSystemdUnitFailed
2026-04-17 20:36:42 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1057.eqiad.wmnet with reason: host reimage
2026-04-17 20:36:48 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 20:36:53 <icinga-wm> RECOVERY - MegaRAID on pc1011 is OK: OK: optimal, 1 logical, 10 physical, WriteBack policy https://wikitech.wikimedia.org/wiki/MegaCli%23Monitoring
2026-04-17 20:37:07 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.provision for host pc2021.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 20:37:23 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 20:37:23 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.provision for host pc2022.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 20:37:24 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1055.eqiad.wmnet with OS bookworm
2026-04-17 20:37:36 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834858 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1055.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 20:37:43 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1066.eqiad.wmnet with OS bookworm
2026-04-17 20:37:45 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.provision for host pc2023.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 20:37:49 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834859 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1066.eqiad.wmnet with OS bookworm'
2026-04-17 20:37:59 <wikibugs> ('PS1) ''Dzahn: etherpad: add 90 day deletion warning to default pad message [puppet] - ''https://gerrit.wikimedia.org/r/1273991 (https://phabricator.wikimedia.org/T421315)'
2026-04-17 20:38:01 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.provision for host pc2024.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 20:38:55 <wikibugs> ('CR) ''Dzahn: [C:''+2] etherpad: add 90 day deletion warning to default pad message [puppet] - ''https://gerrit.wikimedia.org/r/1273991 (https://phabricator.wikimedia.org/T421315) (owner: ''Dzahn)'
2026-04-17 20:39:08 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1063.eqiad.wmnet with reason: host reimage
2026-04-17 20:40:06 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1058.eqiad.wmnet with reason: host reimage
2026-04-17 20:42:03 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1059.eqiad.wmnet with reason: host reimage
2026-04-17 20:42:59 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1065.eqiad.wmnet with reason: host reimage
2026-04-17 20:43:00 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 20:43:22 <wikibugs> ('CR) ''Catrope: Set CSP to enforce with currently-allow-listed domains on Beta (''1 comment) [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1272895 (https://phabricator.wikimedia.org/T419612) (owner: ''SBassett)'
2026-04-17 20:43:23 <jinxer-wm> FIRING: [4x] ProbeDown: Service aqs1010-a:7000 has failed probes (tcp_cassandra_a_ssl_ip4) - https://grafana.wikimedia.org/d/O0nHhdhnz/network-probes-overview?var-job=probes/custom&var-module=All - https://alerts.wikimedia.org/?q=alertname%3DProbeDown
2026-04-17 20:43:23 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 20:43:24 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1064.eqiad.wmnet with OS bookworm
2026-04-17 20:43:28 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834898 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1064.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 20:45:04 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1058.eqiad.wmnet with reason: host reimage
2026-04-17 20:45:05 <wikibugs> 'ops-eqiad, ''SRE, ''DBA, ''DC-Ops: Degraded RAID on pc1011 - https://phabricator.wikimedia.org/T423630#11834899 (''Jclark-ctr) ''Open''Resolved Drive restored error cleared'
2026-04-17 20:46:45 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 20:47:26 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 20:47:27 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1061.eqiad.wmnet with OS bookworm
2026-04-17 20:47:32 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834904 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1061.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 20:47:35 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834905 (''Jclark-ctr)'
2026-04-17 20:47:51 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host pc2021.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 20:48:33 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1066.eqiad.wmnet with reason: host reimage
2026-04-17 20:48:34 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host pc2023.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 20:48:46 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834906 (''Jclark-ctr)'
2026-04-17 20:48:50 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host pc2024.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 20:49:36 <wikibugs> ('PS1) ''Dzahn: etherpad: stop puppet from adding the same file_line multiple times [puppet] - ''https://gerrit.wikimedia.org/r/1274005 (https://phabricator.wikimedia.org/T420793)'
2026-04-17 20:50:07 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 20:50:33 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1065.eqiad.wmnet with reason: host reimage
2026-04-17 20:50:34 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 20:50:35 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1062.eqiad.wmnet with OS bookworm
2026-04-17 20:50:38 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834911 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1062.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 20:51:40 <wikibugs> ('PS2) ''Dzahn: etherpad: stop puppet from adding the same file_line multiple times [puppet] - ''https://gerrit.wikimedia.org/r/1274005 (https://phabricator.wikimedia.org/T420793)'
2026-04-17 20:51:44 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host pc2022.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 20:53:36 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 20:54:00 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 20:54:01 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1057.eqiad.wmnet with OS bookworm
2026-04-17 20:54:06 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834917 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1057.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 20:54:28 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834918 (''Jclark-ctr)'
2026-04-17 20:54:30 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834919 (''Jclark-ctr)'
2026-04-17 20:54:35 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1066.eqiad.wmnet with reason: host reimage
2026-04-17 20:55:01 <wikibugs> 'ops-eqiad, ''SRE, ''Data-Persistence, ''DC-Ops: Q4:rack/setup/install pc102[1-4] - https://phabricator.wikimedia.org/T418908#11834920 (''VRiley-WMF) a:''VRiley-WMF'
2026-04-17 20:55:10 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1067.eqiad.wmnet with OS bookworm
2026-04-17 20:55:14 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834921 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1067.eqiad.wmnet with OS bookworm'
2026-04-17 20:56:19 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1068.eqiad.wmnet with OS bookworm
2026-04-17 20:56:26 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834922 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1068.eqiad.wmnet with OS bookworm'
2026-04-17 20:59:20 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1063.eqiad.wmnet with reason: host reimage
2026-04-17 20:59:37 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 20:59:49 <wikibugs> ('CR) ''Dzahn: [C:''+2] etherpad: stop puppet from adding the same file_line multiple times [puppet] - ''https://gerrit.wikimedia.org/r/1274005 (https://phabricator.wikimedia.org/T420793) (owner: ''Dzahn)'
2026-04-17 21:00:37 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 21:00:40 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1059.eqiad.wmnet with OS bookworm
2026-04-17 21:00:49 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834929 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1059.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 21:01:10 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834930 (''Jclark-ctr)'
2026-04-17 21:02:02 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 21:02:07 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1069.eqiad.wmnet with OS bookworm
2026-04-17 21:02:14 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834936 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1069.eqiad.wmnet with OS bookworm'
2026-04-17 21:02:21 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 21:02:22 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1058.eqiad.wmnet with OS bookworm
2026-04-17 21:02:27 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834937 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1058.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 21:02:44 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834938 (''Jclark-ctr)'
2026-04-17 21:03:07 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1070.eqiad.wmnet with OS bookworm
2026-04-17 21:03:14 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834939 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1070.eqiad.wmnet with OS bookworm'
2026-04-17 21:03:18 <wikibugs> ('PS1) ''CDanis: More features and fixes for historical API [software/klaxon] - ''https://gerrit.wikimedia.org/r/1274025'
2026-04-17 21:03:18 <wikibugs> ('PS1) ''CDanis: Add SQLite-backed incident store, migrations, and weekly analytics CLI [software/klaxon] - ''https://gerrit.wikimedia.org/r/1274026'
2026-04-17 21:03:29 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.provision for host pc2021.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 21:03:45 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.provision for host pc2022.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 21:04:01 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.provision for host pc2023.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 21:04:17 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.provision for host pc2024.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 21:04:53 <wikibugs> ('CR) ''CI reject: [V:''-1] Add SQLite-backed incident store, migrations, and weekly analytics CLI [software/klaxon] - ''https://gerrit.wikimedia.org/r/1274026 (owner: ''CDanis)'
2026-04-17 21:05:19 <wikibugs> ('PS2) ''CDanis: Add SQLite-backed incident store, migrations, and weekly analytics CLI [software/klaxon] - ''https://gerrit.wikimedia.org/r/1274026'
2026-04-17 21:06:35 <wikibugs> ('CR) ''CI reject: [V:''-1] Add SQLite-backed incident store, migrations, and weekly analytics CLI [software/klaxon] - ''https://gerrit.wikimedia.org/r/1274026 (owner: ''CDanis)'
2026-04-17 21:06:55 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1068.eqiad.wmnet with reason: host reimage
2026-04-17 21:07:33 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host pc2021.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 21:07:41 <logmsgbot> !log jclark@cumin1003 END (FAIL) - Cookbook sre.hosts.reimage (exit_code=99) for host mc1065.eqiad.wmnet with OS bookworm
2026-04-17 21:07:51 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834964 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1065.eqiad.wmnet with OS bookworm executed with er...'
2026-04-17 21:08:06 <jinxer-wm> FIRING: [2x] CoreRouterInterfaceDown: Core router interface down - cr2-codfw:et-0/1/4 (Transport: cr2-eqiad:et-1/1/5 (Lumen, 449169461) {#3909}) - https://wikitech.wikimedia.org/wiki/Network_monitoring#Router_interface_down - https://alerts.wikimedia.org/?q=alertname%3DCoreRouterInterfaceDown
2026-04-17 21:08:36 <wikibugs> ('PS3) ''CDanis: WIP [DNM] Add SQLite-backed incident store and analytics CLI [software/klaxon] - ''https://gerrit.wikimedia.org/r/1274026'
2026-04-17 21:09:04 <icinga-wm> PROBLEM - OSPF status on cr1-drmrs is CRITICAL: OSPFv2: 2/3 UP : OSPFv3: 2/3 UP https://wikitech.wikimedia.org/wiki/Network_monitoring%23OSPF_status
2026-04-17 21:09:49 <wikibugs> ('CR) ''CI reject: [V:''-1] WIP [DNM] Add SQLite-backed incident store and analytics CLI [software/klaxon] - ''https://gerrit.wikimedia.org/r/1274026 (owner: ''CDanis)'
2026-04-17 21:09:51 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host pc2022.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 21:09:58 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1065.eqiad.wmnet with OS bookworm
2026-04-17 21:10:05 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host pc2023.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 21:10:09 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834967 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1065.eqiad.wmnet with OS bookworm'
2026-04-17 21:10:20 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host pc2024.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 21:10:49 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1068.eqiad.wmnet with reason: host reimage
2026-04-17 21:12:47 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 21:12:51 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1069.eqiad.wmnet with reason: host reimage
2026-04-17 21:13:12 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 21:13:13 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1066.eqiad.wmnet with OS bookworm
2026-04-17 21:13:16 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834985 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1066.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 21:13:38 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11834986 (''Jclark-ctr)'
2026-04-17 21:14:16 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hardware.upgrade-firmware upgrade firmware for hosts ['pc2021']
2026-04-17 21:14:31 <logmsgbot> !log jhancock@cumin2002 END (FAIL) - Cookbook sre.hardware.upgrade-firmware (exit_code=1) upgrade firmware for hosts ['pc2021']
2026-04-17 21:14:54 <jinxer-wm> FIRING: [2x] TransitBGPDown: Transit BGP session down between cr1-magru and Telxius (2001:1498:1:966:1::251) - https://wikitech.wikimedia.org/wiki/Network_monitoring#BGP_status - https://alerts.wikimedia.org/?q=alertname%3DTransitBGPDown
2026-04-17 21:15:34 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.reimage for host pc2021.codfw.wmnet with OS trixie
2026-04-17 21:15:42 <wikibugs> 'ops-codfw, ''SRE, ''Data-Persistence, ''DC-Ops: Q3:rack/setup/install pc202[1-4] - https://phabricator.wikimedia.org/T418907#11835004 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jhancock@cumin2002 for host pc2021.codfw.wmnet with OS trixie'
2026-04-17 21:15:52 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.reimage for host pc2022.codfw.wmnet with OS trixie
2026-04-17 21:16:00 <wikibugs> 'ops-codfw, ''SRE, ''Data-Persistence, ''DC-Ops: Q3:rack/setup/install pc202[1-4] - https://phabricator.wikimedia.org/T418907#11835005 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jhancock@cumin2002 for host pc2022.codfw.wmnet with OS trixie'
2026-04-17 21:16:03 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 21:16:10 <wikibugs> ('CR) ''Dzahn: [C:''-1] "21 needs to be a string" [puppet] - ''https://gerrit.wikimedia.org/r/1271032 (https://phabricator.wikimedia.org/T418109) (owner: ''Dzahn)'
2026-04-17 21:16:18 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.reimage for host pc2023.codfw.wmnet with OS trixie
2026-04-17 21:16:29 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 21:16:29 <wikibugs> 'ops-codfw, ''SRE, ''Data-Persistence, ''DC-Ops: Q3:rack/setup/install pc202[1-4] - https://phabricator.wikimedia.org/T418907#11835006 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jhancock@cumin2002 for host pc2023.codfw.wmnet with OS trixie'
2026-04-17 21:16:30 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1063.eqiad.wmnet with OS bookworm
2026-04-17 21:16:31 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.reimage for host pc2024.codfw.wmnet with OS trixie
2026-04-17 21:16:34 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835007 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1063.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 21:16:38 <wikibugs> 'ops-codfw, ''SRE, ''Data-Persistence, ''DC-Ops: Q3:rack/setup/install pc202[1-4] - https://phabricator.wikimedia.org/T418907#11835008 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jhancock@cumin2002 for host pc2024.codfw.wmnet with OS trixie'
2026-04-17 21:16:40 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835009 (''Jclark-ctr)'
2026-04-17 21:17:17 <wikibugs> ('CR) ''SBassett: Set CSP to enforce with currently-allow-listed domains on Beta (''1 comment) [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1272895 (https://phabricator.wikimedia.org/T419612) (owner: ''SBassett)'
2026-04-17 21:17:27 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835011 (''Jclark-ctr)'
2026-04-17 21:18:40 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1069.eqiad.wmnet with reason: host reimage
2026-04-17 21:21:48 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1065.eqiad.wmnet with reason: host reimage
2026-04-17 21:23:06 <wikibugs> ('CR) ''JHathaway: [C:''+1] ipmi: rework how to use a different user (''1 comment) [software/spicerack] - ''https://gerrit.wikimedia.org/r/1271631 (https://phabricator.wikimedia.org/T418929) (owner: ''Elukey)'
2026-04-17 21:23:36 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1071.eqiad.wmnet with OS bookworm
2026-04-17 21:23:42 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835020 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1071.eqiad.wmnet with OS bookworm'
2026-04-17 21:24:04 <logmsgbot> !log jclark@cumin1003 END (FAIL) - Cookbook sre.hosts.reimage (exit_code=99) for host mc1056.eqiad.wmnet with OS bookworm
2026-04-17 21:24:09 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835025 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1056.eqiad.wmnet with OS bookworm executed with er...'
2026-04-17 21:27:26 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 21:28:47 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1065.eqiad.wmnet with reason: host reimage
2026-04-17 21:30:32 <logmsgbot> jclark@cumin1003 reimage (PID 2544631) is awaiting input
2026-04-17 21:32:15 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.downtime for 2:00:00 on pc2021.codfw.wmnet with reason: host reimage
2026-04-17 21:33:06 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1056.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 21:34:29 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1071.eqiad.wmnet with reason: host reimage
2026-04-17 21:34:56 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 21:34:57 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1068.eqiad.wmnet with OS bookworm
2026-04-17 21:35:04 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835039 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1068.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 21:35:27 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835040 (''Jclark-ctr)'
2026-04-17 21:35:27 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 21:35:30 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.downtime for 2:00:00 on pc2022.codfw.wmnet with reason: host reimage
2026-04-17 21:35:46 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 21:35:47 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1069.eqiad.wmnet with OS bookworm
2026-04-17 21:35:51 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835052 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1069.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 21:36:21 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.downtime for 2:00:00 on pc2023.codfw.wmnet with reason: host reimage
2026-04-17 21:36:21 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835054 (''Jclark-ctr)'
2026-04-17 21:37:39 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.downtime for 2:00:00 on pc2024.codfw.wmnet with reason: host reimage
2026-04-17 21:39:21 <logmsgbot> !log jclark@cumin1003 END (FAIL) - Cookbook sre.hosts.provision (exit_code=99) for host mc1056.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 21:39:36 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on pc2021.codfw.wmnet with reason: host reimage
2026-04-17 21:41:08 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1056.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 21:41:51 <wikibugs> ('CR) ''Jcrespo: "Absolutely not, but the decom script may warn you incorrectly about references left behind or searching could cause false positives for th" [puppet] - ''https://gerrit.wikimedia.org/r/1273699 (https://phabricator.wikimedia.org/T422851) (owner: ''Jcrespo)'
2026-04-17 21:42:27 <logmsgbot> !log jclark@cumin1003 END (FAIL) - Cookbook sre.hosts.provision (exit_code=99) for host mc1056.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 21:42:36 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on pc2023.codfw.wmnet with reason: host reimage
2026-04-17 21:45:06 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1065.eqiad.wmnet with OS bookworm
2026-04-17 21:45:10 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835087 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1065.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 21:47:23 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on pc2022.codfw.wmnet with reason: host reimage
2026-04-17 21:48:10 <wikibugs> ('PS1) ''Ryan Kemper: cloudelastic1012: override common_settings merge to first [puppet] - ''https://gerrit.wikimedia.org/r/1274061 (https://phabricator.wikimedia.org/T422860)'
2026-04-17 21:48:45 <wikibugs> ('CR) ''Ryan Kemper: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1274061 (https://phabricator.wikimedia.org/T422860) (owner: ''Ryan Kemper)'
2026-04-17 21:49:09 <wikibugs> ('CR) ''Bking: [C:''+1] cloudelastic1012: override common_settings merge to first [puppet] - ''https://gerrit.wikimedia.org/r/1274061 (https://phabricator.wikimedia.org/T422860) (owner: ''Ryan Kemper)'
2026-04-17 21:51:01 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1071.eqiad.wmnet with reason: host reimage
2026-04-17 21:51:19 <wikibugs> ('PS1) ''Dzahn: ci::docker: do not try to install docker-cli on bookworm [puppet] - ''https://gerrit.wikimedia.org/r/1274067 (https://phabricator.wikimedia.org/T418109)'
2026-04-17 21:52:11 <wikibugs> ('CR) ''Ryan Kemper: "PCC looks terrible, this overrode whole common_settings. fixing" [puppet] - ''https://gerrit.wikimedia.org/r/1274061 (https://phabricator.wikimedia.org/T422860) (owner: ''Ryan Kemper)'
2026-04-17 21:52:43 <logmsgbot> jclark@cumin1003 provision (PID 2561685) is awaiting input
2026-04-17 21:53:06 <wikibugs> ('CR) ''Catrope: Set CSP to enforce with currently-allow-listed domains on Beta (''1 comment) [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1272895 (https://phabricator.wikimedia.org/T419612) (owner: ''SBassett)'
2026-04-17 21:54:15 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jhancock@cumin2002"
2026-04-17 21:54:45 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jhancock@cumin2002"
2026-04-17 21:54:46 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host pc2021.codfw.wmnet with OS trixie
2026-04-17 21:54:55 <wikibugs> 'ops-codfw, ''SRE, ''Data-Persistence, ''DC-Ops: Q3:rack/setup/install pc202[1-4] - https://phabricator.wikimedia.org/T418907#11835103 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jhancock@cumin2002 for host pc2021.codfw.wmnet with OS trixie completed: - pc2021 (**PASS**) - Rem...'
2026-04-17 21:55:10 <wikibugs> ('PS1) ''Ryan Kemper: cloudelastic1012: full common_settings override for OS2 [puppet] - ''https://gerrit.wikimedia.org/r/1274075 (https://phabricator.wikimedia.org/T422860)'
2026-04-17 21:55:56 <wikibugs> ('Abandoned) ''Ryan Kemper: cloudelastic1012: full common_settings override for OS2 [puppet] - ''https://gerrit.wikimedia.org/r/1274075 (https://phabricator.wikimedia.org/T422860) (owner: ''Ryan Kemper)'
2026-04-17 21:56:40 <wikibugs> ('PS2) ''Ryan Kemper: cloudelastic1012: full common_settings override for OS2 [puppet] - ''https://gerrit.wikimedia.org/r/1274061 (https://phabricator.wikimedia.org/T422860)'
2026-04-17 21:56:56 <wikibugs> ('CR) ''Ryan Kemper: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1274061 (https://phabricator.wikimedia.org/T422860) (owner: ''Ryan Kemper)'
2026-04-17 21:57:52 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1072.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 21:58:51 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jhancock@cumin2002"
2026-04-17 21:59:25 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on pc2024.codfw.wmnet with reason: host reimage
2026-04-17 22:00:12 <wikibugs> ('CR) ''Ryan Kemper: [C:''+2] "PCC looks correct now; merging" [puppet] - ''https://gerrit.wikimedia.org/r/1274061 (https://phabricator.wikimedia.org/T422860) (owner: ''Ryan Kemper)'
2026-04-17 22:00:37 <wikibugs> ('PS2) ''Dzahn: ci::docker: only install docker-cli if on trixie or newer [puppet] - ''https://gerrit.wikimedia.org/r/1274067 (https://phabricator.wikimedia.org/T418109)'
2026-04-17 22:01:39 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jhancock@cumin2002"
2026-04-17 22:01:40 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jhancock@cumin2002"
2026-04-17 22:01:40 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host pc2023.codfw.wmnet with OS trixie
2026-04-17 22:01:52 <wikibugs> 'ops-codfw, ''SRE, ''Data-Persistence, ''DC-Ops: Q3:rack/setup/install pc202[1-4] - https://phabricator.wikimedia.org/T418907#11835127 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jhancock@cumin2002 for host pc2023.codfw.wmnet with OS trixie completed: - pc2023 (**PASS**) - Rem...'
2026-04-17 22:02:08 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jhancock@cumin2002"
2026-04-17 22:02:10 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host pc2022.codfw.wmnet with OS trixie
2026-04-17 22:02:22 <wikibugs> 'ops-codfw, ''SRE, ''Data-Persistence, ''DC-Ops: Q3:rack/setup/install pc202[1-4] - https://phabricator.wikimedia.org/T418907#11835128 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jhancock@cumin2002 for host pc2022.codfw.wmnet with OS trixie completed: - pc2022 (**PASS**) - Rem...'
2026-04-17 22:02:50 <wikibugs> ('CR) ''Thcipriani: [C:''+1] "cherry pick seems to work on integration-docker-agent" [puppet] - ''https://gerrit.wikimedia.org/r/1274067 (https://phabricator.wikimedia.org/T418109) (owner: ''Dzahn)'
2026-04-17 22:06:19 <wikibugs> ('PS4) ''SBassett: Set CSP to enforce with currently-allow-listed domains on Beta [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1272895 (https://phabricator.wikimedia.org/T419612)'
2026-04-17 22:06:44 <wikibugs> ('CR) ''SBassett: Set CSP to enforce with currently-allow-listed domains on Beta (''1 comment) [mediawiki-config] - ''https://gerrit.wikimedia.org/r/1272895 (https://phabricator.wikimedia.org/T419612) (owner: ''SBassett)'
2026-04-17 22:08:40 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1072.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 22:08:47 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 22:09:02 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 22:09:03 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1071.eqiad.wmnet with OS bookworm
2026-04-17 22:09:07 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835132 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1071.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 22:09:31 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1072.eqiad.wmnet with OS bookworm
2026-04-17 22:09:40 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835135 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1072.eqiad.wmnet with OS bookworm'
2026-04-17 22:10:51 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835136 (''Jclark-ctr)'
2026-04-17 22:13:12 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1056.eqiad.wmnet with OS bookworm
2026-04-17 22:13:16 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835137 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1056.eqiad.wmnet with OS bookworm'
2026-04-17 22:13:37 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jhancock@cumin2002"
2026-04-17 22:15:22 <logmsgbot> !log jclark@cumin1003 END (FAIL) - Cookbook sre.hosts.reimage (exit_code=99) for host mc1067.eqiad.wmnet with OS bookworm
2026-04-17 22:15:25 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835141 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1067.eqiad.wmnet with OS bookworm executed with er...'
2026-04-17 22:16:42 <logmsgbot> jhancock@cumin2002 reimage (PID 2138794) is awaiting input
2026-04-17 22:16:50 <icinga-wm> RECOVERY - OSPF status on cr1-magru is OK: OSPFv2: 2/2 UP : OSPFv3: 2/2 UP https://wikitech.wikimedia.org/wiki/Network_monitoring%23OSPF_status
2026-04-17 22:18:45 <jinxer-wm> FIRING: WidespreadPuppetFailure: Puppet has failed in magru - https://puppetboard.wikimedia.org/nodes?status=failed - https://grafana.wikimedia.org/d/yOxVDGvWk/puppet?orgId=1&viewPanel=6 - https://alerts.wikimedia.org/?q=alertname%3DWidespreadPuppetFailure
2026-04-17 22:19:39 <jinxer-wm> RESOLVED: [2x] TransitBGPDown: Transit BGP session down between cr1-magru and Telxius (2001:1498:1:966:1::251) - https://wikitech.wikimedia.org/wiki/Network_monitoring#BGP_status - https://alerts.wikimedia.org/?q=alertname%3DTransitBGPDown
2026-04-17 22:19:48 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jhancock@cumin2002"
2026-04-17 22:19:50 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host pc2024.codfw.wmnet with OS trixie
2026-04-17 22:19:57 <wikibugs> 'ops-codfw, ''SRE, ''Data-Persistence, ''DC-Ops: Q3:rack/setup/install pc202[1-4] - https://phabricator.wikimedia.org/T418907#11835154 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jhancock@cumin2002 for host pc2024.codfw.wmnet with OS trixie completed: - pc2024 (**PASS**) - Rem...'
2026-04-17 22:20:10 <jinxer-wm> RESOLVED: [2x] BFDdown: BFD session down between cr2-eqiad and 195.200.68.151 - https://wikitech.wikimedia.org/wiki/Network_monitoring#BFD_status - https://grafana.wikimedia.org/d/fb403d62-5f03-434a-9dff-bd02b9fff504/network-device-overview?var-instance=cr2-eqiad:9804 - https://alerts.wikimedia.org/?q=alertname%3DBFDdown
2026-04-17 22:20:15 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1072.eqiad.wmnet with reason: host reimage
2026-04-17 22:20:40 <jinxer-wm> RESOLVED: [4x] CoreBGPDown: Core BGP session down between cr1-magru and cr2-eqiad (195.200.68.150) - group Confed_eqiad - https://wikitech.wikimedia.org/wiki/Network_monitoring#BGP_status - https://alerts.wikimedia.org/?q=alertname%3DCoreBGPDown
2026-04-17 22:20:44 <wikibugs> 'ops-codfw, ''SRE, ''Data-Persistence, ''DC-Ops: Q3:rack/setup/install pc202[1-4] - https://phabricator.wikimedia.org/T418907#11835155 (''Jhancock.wm) ''Open''Resolved'
2026-04-17 22:21:05 <wikibugs> 'ops-codfw, ''SRE, ''Data-Persistence, ''DC-Ops: Q3:rack/setup/install pc202[1-4] - https://phabricator.wikimedia.org/T418907#11835158 (''Jhancock.wm) @Marostegui these are complete!'
2026-04-17 22:23:20 <logmsgbot> !log jclark@cumin1003 END (FAIL) - Cookbook sre.hosts.reimage (exit_code=99) for host mc1070.eqiad.wmnet with OS bookworm
2026-04-17 22:23:28 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835160 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1070.eqiad.wmnet with OS bookworm executed with er...'
2026-04-17 22:24:38 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1072.eqiad.wmnet with reason: host reimage
2026-04-17 22:33:18 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1056.eqiad.wmnet with reason: host reimage
2026-04-17 22:35:32 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1067.eqiad.wmnet with OS bookworm
2026-04-17 22:35:41 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835182 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1067.eqiad.wmnet with OS bookworm'
2026-04-17 22:36:51 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1067.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 22:37:32 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.provision for host db2250.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 22:38:03 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.provision for host db2251.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 22:38:06 <logmsgbot> !log jclark@cumin1003 END (FAIL) - Cookbook sre.hosts.provision (exit_code=99) for host mc1067.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 22:38:19 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.provision for host db2252.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 22:38:22 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1067.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 22:38:35 <logmsgbot> !log jhancock@cumin2002 START - Cookbook sre.hosts.provision for host db2253.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 22:39:12 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1056.eqiad.wmnet with reason: host reimage
2026-04-17 22:40:34 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 22:40:50 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 22:40:51 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1072.eqiad.wmnet with OS bookworm
2026-04-17 22:40:58 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835190 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1072.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 22:41:21 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1070.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 22:42:50 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835191 (''Jclark-ctr)'
2026-04-17 22:45:15 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1067.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 22:48:28 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host db2250.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 22:48:45 <jinxer-wm> RESOLVED: WidespreadPuppetFailure: Puppet has failed in magru - https://puppetboard.wikimedia.org/nodes?status=failed - https://grafana.wikimedia.org/d/yOxVDGvWk/puppet?orgId=1&viewPanel=6 - https://alerts.wikimedia.org/?q=alertname%3DWidespreadPuppetFailure
2026-04-17 22:49:04 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host db2252.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 22:49:17 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host db2251.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 22:49:22 <logmsgbot> !log jhancock@cumin2002 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host db2253.mgmt.codfw.wmnet with chassis set policy FORCE_RESTART and with Dell SCP reboot policy FORCED
2026-04-17 22:50:35 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.reimage for host mc1070.eqiad.wmnet with OS bookworm
2026-04-17 22:50:40 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835200 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage was started by jclark@cumin1003 for host mc1070.eqiad.wmnet with OS bookworm'
2026-04-17 22:51:05 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1070.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 22:54:10 <wikibugs> ('PS1) ''Ryan Kemper: cloudelastic1012: full common_settings override for OS2 [puppet] - ''https://gerrit.wikimedia.org/r/1274134 (https://phabricator.wikimedia.org/T422860)'
2026-04-17 22:54:43 <wikibugs> ('CR) ''Ryan Kemper: "check experimental" [puppet] - ''https://gerrit.wikimedia.org/r/1274134 (https://phabricator.wikimedia.org/T422860) (owner: ''Ryan Kemper)'
2026-04-17 22:56:20 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 22:56:36 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 22:56:37 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1056.eqiad.wmnet with OS bookworm
2026-04-17 22:56:41 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835205 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1056.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 22:57:11 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835206 (''Jclark-ctr)'
2026-04-17 22:57:21 <logmsgbot> jclark@cumin1003 provision (PID 2567031) is awaiting input
2026-04-17 22:57:45 <wikibugs> ('CR) ''Ryan Kemper: "PCC shows -BindPaths=/usr/share/opensearch/plugins/ltr as desired; merging" [puppet] - ''https://gerrit.wikimedia.org/r/1274134 (https://phabricator.wikimedia.org/T422860) (owner: ''Ryan Kemper)'
2026-04-17 22:57:46 <wikibugs> ('CR) ''Ryan Kemper: [C:''+2] cloudelastic1012: full common_settings override for OS2 [puppet] - ''https://gerrit.wikimedia.org/r/1274134 (https://phabricator.wikimedia.org/T422860) (owner: ''Ryan Kemper)'
2026-04-17 23:00:27 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.provision for host mc1070.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 23:01:58 <wikibugs> ('PS1) ''Dzahn: etherpad: avoid adding warning message multiple times [puppet] - ''https://gerrit.wikimedia.org/r/1274138 (https://phabricator.wikimedia.org/T420793)'
2026-04-17 23:04:12 <wikibugs> ('CR) ''Dzahn: [C:''+2] etherpad: avoid adding warning message multiple times [puppet] - ''https://gerrit.wikimedia.org/r/1274138 (https://phabricator.wikimedia.org/T420793) (owner: ''Dzahn)'
2026-04-17 23:05:26 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1067.eqiad.wmnet with reason: host reimage
2026-04-17 23:07:12 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.provision (exit_code=0) for host mc1070.mgmt.eqiad.wmnet with chassis set policy FORCE_RESTART
2026-04-17 23:08:45 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1067.eqiad.wmnet with reason: host reimage
2026-04-17 23:10:23 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] START helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich-next: apply
2026-04-17 23:10:27 <logmsgbot> !log otto@deploy1003 helmfile [dse-k8s-eqiad] DONE helmfile.d/dse-k8s-services/mw-page-html-content-change-enrich-next: apply
2026-04-17 23:21:33 <wikibugs> ('PS1) ''Dzahn: etherpad: remove code to insert warning message [puppet] - ''https://gerrit.wikimedia.org/r/1274151 (https://phabricator.wikimedia.org/T420793)'
2026-04-17 23:22:49 <wikibugs> ('PS2) ''Dzahn: etherpad: remove code to insert warning message [puppet] - ''https://gerrit.wikimedia.org/r/1274151 (https://phabricator.wikimedia.org/T420793)'
2026-04-17 23:23:10 <wikibugs> ('CR) ''Dzahn: [C:''+2] etherpad: remove code to insert warning message [puppet] - ''https://gerrit.wikimedia.org/r/1274151 (https://phabricator.wikimedia.org/T420793) (owner: ''Dzahn)'
2026-04-17 23:24:38 <wikibugs> ('CR) ''Dzahn: [C:''+2] "recheck" [puppet] - ''https://gerrit.wikimedia.org/r/1274151 (https://phabricator.wikimedia.org/T420793) (owner: ''Dzahn)'
2026-04-17 23:24:49 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.hosts.downtime for 2:00:00 on mc1070.eqiad.wmnet with reason: host reimage
2026-04-17 23:25:56 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 23:25:59 <jinxer-wm> FIRING: KubernetesDeploymentUnavailableReplicas: ...
2026-04-17 23:25:59 <jinxer-wm> Deployment linkrecommendation-internal in linkrecommendation at eqiad has persistently unavailable replicas - https://wikitech.wikimedia.org/wiki/Kubernetes/Troubleshooting#Troubleshooting_a_deployment - https://grafana.wikimedia.org/d/a260da06-259a-4ee4-9540-5cab01a246c8/kubernetes-deployment-details?var-site=eqiad&var-cluster=k8s&var-namespace=linkrecommendation&var-deployment=linkrecommendation-internal - ...
2026-04-17 23:25:59 <jinxer-wm> https://alerts.wikimedia.org/?q=alertname%3DKubernetesDeploymentUnavailableReplicas
2026-04-17 23:26:14 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 23:26:15 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1067.eqiad.wmnet with OS bookworm
2026-04-17 23:26:25 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835283 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1067.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 23:26:41 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835284 (''Jclark-ctr)'
2026-04-17 23:31:42 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.downtime (exit_code=0) for 2:00:00 on mc1070.eqiad.wmnet with reason: host reimage
2026-04-17 23:40:09 <wikibugs> ('PS1) ''TrainBranchBot: Branch commit for wmf/branch_cut_pretest [core] (wmf/branch_cut_pretest) - ''https://gerrit.wikimedia.org/r/1274153'
2026-04-17 23:40:09 <wikibugs> ('CR) ''TrainBranchBot: [C:''+2] Branch commit for wmf/branch_cut_pretest [core] (wmf/branch_cut_pretest) - ''https://gerrit.wikimedia.org/r/1274153 (owner: ''TrainBranchBot)'
2026-04-17 23:48:13 <logmsgbot> !log jclark@cumin1003 START - Cookbook sre.puppet.sync-netbox-hiera generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 23:51:16 <wikibugs> ('Merged) ''jenkins-bot: Branch commit for wmf/branch_cut_pretest [core] (wmf/branch_cut_pretest) - ''https://gerrit.wikimedia.org/r/1274153 (owner: ''TrainBranchBot)'
2026-04-17 23:51:19 <logmsgbot> jclark@cumin1003 reimage (PID 2575711) is awaiting input
2026-04-17 23:52:24 <wikibugs> ('PS1) ''Ecarg: Wikifunctions: add helm values for function-evaluator in Rust [deployment-charts] - ''https://gerrit.wikimedia.org/r/1274165 (https://phabricator.wikimedia.org/T423627)'
2026-04-17 23:53:05 <wikibugs> ('CR) ''Ecarg: Wikifunctions: add helm values for function-evaluator in Rust (''1 comment) [deployment-charts] - ''https://gerrit.wikimedia.org/r/1274165 (https://phabricator.wikimedia.org/T423627) (owner: ''Ecarg)'
2026-04-17 23:55:06 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.puppet.sync-netbox-hiera (exit_code=0) generate netbox hiera data: "Triggered by cookbooks.sre.hosts.reimage: Host reimage - jclark@cumin1003"
2026-04-17 23:55:07 <logmsgbot> !log jclark@cumin1003 END (PASS) - Cookbook sre.hosts.reimage (exit_code=0) for host mc1070.eqiad.wmnet with OS bookworm
2026-04-17 23:55:15 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835321 (''ops-monitoring-bot) Cookbook cookbooks.sre.hosts.reimage started by jclark@cumin1003 for host mc1070.eqiad.wmnet with OS bookworm completed: - mc1...'
2026-04-17 23:55:31 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835324 (''Jclark-ctr)'
2026-04-17 23:56:09 <wikibugs> 'ops-eqiad, ''DC-Ops, ''ServiceOps new, ''ServiceOps-Upgrades-Hardware: Q2:rack/setup/install mc1055-72 - https://phabricator.wikimedia.org/T412255#11835325 (''Jclark-ctr) ''Open''Resolved @jijiki install is finished'

This page is generated from SQL logs, you can also download static txt files from here