devuelve cuando es positivo y cuando es negativo1. Llamada función rampa o parte positiva, consta de dos semirrectas que se encuentran formando un pico en el origen. La fórmula es sencilla pero, como ejemplo situado en la frontera de la derivabilidad y como función de activación en aprendizaje automático, su alcance es amplio.
El mayor de dos números puede escribirse . Tomar y da lo siguiente.
La relación funciona también en sentido contrario.
El valor absoluto y la función rampa se construyen mutuamente, mediante una suma y una diferencia.
El dominio es el conjunto de todos los números reales y el rango es . La gráfica va sobre el eje en el lado negativo y sobre la recta en el positivo.
| Zona | ||
|---|---|---|
| indefinida | ||
La derivada por la derecha es y por la izquierda es , y no coinciden, así que la función no es derivable en el origen. Es continua, de modo que, como el valor absoluto, es un ejemplo de función continua sin ser derivable.
Lejos del origen la derivada es la función escalón de Heaviside2. Recíprocamente, integrar la función escalón da la función rampa.
La función es convexa. Un segmento que una dos puntos de la gráfica queda siempre por encima de ella, y el único doblez gira hacia abajo. Admitiendo traslaciones y múltiplos escalares, las sumas de funciones rampa producen cualquier poligonal convexa. Que toda función convexa lineal a trozos sea una combinación lineal de funciones rampa es el terreno sobre el que se apoyan las aplicaciones.
La primitiva es la siguiente.
Vale para y para . Esa función es continua y derivable una vez, pero su segunda derivada no coincide en el origen.
| Función | Suavidad en el origen |
|---|---|
| La función escalón de Heaviside | discontinua |
| La función rampa | continua pero no derivable |
| Su primitiva | derivable una vez |
Cada integración sube la suavidad un escalón, como se ve aquí.
En aprendizaje automático esta función se conoce como ReLU y se usa como función de activación, muy extendida porque el gradiente no se desvanece con facilidad ni siquiera a través de muchas capas. Que la red entera se convierta en una función lineal a trozos se sigue de la convexidad y de la superposición que acabamos de describir.