UBUNTU-CVE-2024-42239
In the Linux kernel, the following vulnerability has been resolved: bpf: Fail bpf_timer_cancel when callback is being cancelled Given a schedule: timer1 cb timer2 cb bpf_timer_cancel(timer2); bpf_timer_cancel(timer1); Both bpf_timer_cancel calls would wait for the other callback to finish executing, introducing a lockup. Add an atomic_t count named 'cancelling' in bpf_hrtimer. This keeps track of all in-flight cancellation requests for a given BPF timer. Whenever cancelling a BPF timer, we must check if we have outstanding cancellation requests, and if so, we must fail the operation with an error (-EDEADLK) since cancellation is synchronous and waits for the callback to finish executing. This implies that we can enter a deadlock situation involving two or more timer callbacks executing in parallel and attempting to cancel one another. Note that we avoid incrementing the cancelling counter for the target timer (the one being cancelled) if bpf_timer_cancel is not invoked from a callback, to avoid spurious errors. The whole point of detecting cur->cancelling and returning -EDEADLK is to not enter a busy wait loop (which may or may not lead to a lockup). This does not apply in case the caller is in a non-callback context, the other side can continue to cancel as it sees fit without running into errors. Background on prior attempts: Earlier versions of this patch used a bool 'cancelling' bit and used the following pattern under timer->lock to publish cancellation status. lock(t->lock); t->cancelling = true; mb(); if (cur->cancelling) return -EDEADLK; unlock(t->lock); hrtimer_cancel(t->timer); t->cancelling = false; The store outside the critical section could overwrite a parallel requests t->cancelling assignment to true, to ensure the parallely executing callback observes its cancellation status. It would be necessary to clear this cancelling bit once hrtimer_cancel is done, but lack of serialization introduced races. Another option was explored where bpf_timer_start would clear the bit when (re)starting the timer under timer->lock. This would ensure serialized access to the cancelling bit, but may allow it to be cleared before in-flight hrtimer_cancel has finished executing, such that lockups can occur again. Thus, we choose an atomic counter to keep track of all outstanding cancellation requests and use it to prevent lockups in case callbacks attempt to cancel each other while executing in parallel.
02 / AFFECTED SOFTWARE
Affected packages
11 explicit affected versions
89 explicit affected versions
50 explicit affected versions
6 explicit affected versions
12 explicit affected versions
19 explicit affected versions
6 explicit affected versions
100 explicit affected versions
12 explicit affected versions
85 explicit affected versions
84 explicit affected versions
86 explicit affected versions
76 explicit affected versions
10 explicit affected versions
6 explicit affected versions
12 explicit affected versions
90 explicit affected versions
7 explicit affected versions
84 explicit affected versions
7 explicit affected versions
13 explicit affected versions
9 explicit affected versions
35 explicit affected versions
51 explicit affected versions
50 explicit affected versions
18 explicit affected versions
42 explicit affected versions
64 explicit affected versions
12 explicit affected versions
13 explicit affected versions
4 explicit affected versions
23 explicit affected versions
16 explicit affected versions
21 explicit affected versions
16 explicit affected versions
10 explicit affected versions
14 explicit affected versions
7 explicit affected versions
12 explicit affected versions
12 explicit affected versions
14 explicit affected versions
1 explicit affected versions
7 explicit affected versions
12 explicit affected versions
12 explicit affected versions
7 explicit affected versions
45 explicit affected versions
7 explicit affected versions
1 explicit affected versions
37 explicit affected versions
13 explicit affected versions
5 explicit affected versions
10 explicit affected versions
68 explicit affected versions
26 explicit affected versions
13 explicit affected versions
37 explicit affected versions
29 explicit affected versions
13 explicit affected versions
96 explicit affected versions
6 explicit affected versions
7 explicit affected versions
92 explicit affected versions
55 explicit affected versions
33 explicit affected versions
23 explicit affected versions
60 explicit affected versions
10 explicit affected versions
1 explicit affected versions
11 explicit affected versions
12 explicit affected versions
7 explicit affected versions
12 explicit affected versions
77 explicit affected versions
93 explicit affected versions
10 explicit affected versions
26 explicit affected versions
14 explicit affected versions
1 explicit affected versions
69 explicit affected versions
5 explicit affected versions
15 explicit affected versions
13 explicit affected versions
14 explicit affected versions
16 explicit affected versions
91 explicit affected versions
15 explicit affected versions
3 explicit affected versions
2 explicit affected versions
51 explicit affected versions
12 explicit affected versions
12 explicit affected versions
71 explicit affected versions
80 explicit affected versions
27 explicit affected versions
66 explicit affected versions
8 explicit affected versions
8 explicit affected versions
55 explicit affected versions
5 explicit affected versions
8 explicit affected versions
10 explicit affected versions
11 explicit affected versions
13 explicit affected versions
13 explicit affected versions
7 explicit affected versions
10 explicit affected versions
12 explicit affected versions
39 explicit affected versions
44 explicit affected versions
16 explicit affected versions
3 explicit affected versions
13 explicit affected versions
26 explicit affected versions
45 explicit affected versions
37 explicit affected versions
15 explicit affected versions
14 explicit affected versions
38 explicit affected versions
9 explicit affected versions
11 explicit affected versions
6 explicit affected versions
1 explicit affected versions
92 explicit affected versions
7 explicit affected versions
4 explicit affected versions
81 explicit affected versions
1 explicit affected versions
1 explicit affected versions
91 explicit affected versions
80 explicit affected versions
79 explicit affected versions
13 explicit affected versions
43 explicit affected versions
10 explicit affected versions
8 explicit affected versions
10 explicit affected versions
14 explicit affected versions
4 explicit affected versions
11 explicit affected versions
1 explicit affected versions
8 explicit affected versions
80 explicit affected versions
03 / CONNECTIONS
Connected vulnerabilities
04 / EVIDENCE
Source records
In the Linux kernel, the following vulnerability has been resolved: bpf: Fail bpf_timer_cancel when callback is being cancelled Given a schedule: timer1 cb timer2 cb bpf_timer_cancel(timer2); bpf_timer_cancel(timer1); Both bpf_timer_cancel calls would wait for the other callback to finish executing, introducing a lockup. Add an atomic_t count named 'cancelling' in bpf_hrtimer. This keeps track of all in-flight cancellation requests for a given BPF timer. Whenever cancelling a BPF timer, we must check if we have outstanding cancellation requests, and if so, we must fail the operation with an error (-EDEADLK) since cancellation is synchronous and waits for the callback to finish executing. This implies that we can enter a deadlock situation involving two or more timer callbacks executing in parallel and attempting to cancel one another. Note that we avoid incrementing the cancelling counter for the target timer (the one being cancelled) if bpf_timer_cancel is not invoked from a callback, to avoid spurious errors. The whole point of detecting cur->cancelling and returning -EDEADLK is to not enter a busy wait loop (which may or may not lead to a lockup). This does not apply in case the caller is in a non-callback context, the other side can continue to cancel as it sees fit without running into errors. Background on prior attempts: Earlier versions of this patch used a bool 'cancelling' bit and used the following pattern under timer->lock to publish cancellation status. lock(t->lock); t->cancelling = true; mb(); if (cur->cancelling) return -EDEADLK; unlock(t->lock); hrtimer_cancel(t->timer); t->cancelling = false; The store outside the critical section could overwrite a parallel requests t->cancelling assignment to true, to ensure the parallely executing callback observes its cancellation status. It would be necessary to clear this cancelling bit once hrtimer_cancel is done, but lack of serialization introduced races. Another option was explored where bpf_timer_start would clear the bit when (re)starting the timer under timer->lock. This would ensure serialized access to the cancelling bit, but may allow it to be cleared before in-flight hrtimer_cancel has finished executing, such that lockups can occur again. Thus, we choose an atomic counter to keep track of all outstanding cancellation requests and use it to prevent lockups in case callbacks attempt to cancel each other while executing in parallel.
05 / REFERENCES
Further evidence
- https://git.kernel.org/linus/d4523831f07a267a943f0dde844bf8ead7495f13
- https://git.kernel.org/stable/c/3e4e8178a8666c56813bd167b848fca0f4c9af0a
- https://git.kernel.org/stable/c/9369830518688ecd5b08ffc08ab3302ce2b5d0f7
- https://git.kernel.org/stable/c/d4523831f07a267a943f0dde844bf8ead7495f13
- https://ubuntu.com/security/CVE-2024-42239
- https://ubuntu.com/security/notices/USN-7089-1
- https://ubuntu.com/security/notices/USN-7089-2
- https://ubuntu.com/security/notices/USN-7089-3
- https://ubuntu.com/security/notices/USN-7089-4
- https://ubuntu.com/security/notices/USN-7089-5
- https://ubuntu.com/security/notices/USN-7089-6
- https://ubuntu.com/security/notices/USN-7089-7
- https://ubuntu.com/security/notices/USN-7090-1
- https://ubuntu.com/security/notices/USN-7095-1
- https://ubuntu.com/security/notices/USN-7156-1
- https://www.cve.org/CVERecord?id=CVE-2024-42239