y=max⁡(0, x)y = \max(0,\,x)

Gráfica de la función rampa y=max⁡(0, x)y = \max(0,\,x)

y=max⁡(0, x)y = \max(0,\,x) devuelve xx cuando xx es positivo y 00 cuando es negativo1. Llamada función rampa o parte positiva, consta de dos semirrectas que se encuentran formando un pico en el origen. La fórmula es sencilla pero, como ejemplo situado en la frontera de la derivabilidad y como función de activación en aprendizaje automático, su alcance es amplio.

Expresión con un valor absoluto

El mayor de dos números puede escribirse max⁡(a,b)=a+b+∣a−b∣2\max(a, b) = \dfrac{a + b + |a-b|}{2}. Tomar a=0a = 0 y b=xb = x da lo siguiente.

max⁡(0, x)=x+∣x∣2\max(0,\,x) = \frac{x + |x|}{2}

La relación funciona también en sentido contrario.

∣x∣=max⁡(0, x)+max⁡(0, −x)x=max⁡(0, x)−max⁡(0, −x)\begin{align*} |x| &= \max(0,\,x) + \max(0,\,-x) \\ x &= \max(0,\,x) - \max(0,\,-x) \end{align*}

El valor absoluto y la función rampa se construyen mutuamente, mediante una suma y una diferencia.

Dominio y rango

El dominio es el conjunto de todos los números reales y el rango es y≥0y \geq 0. La gráfica va sobre el eje xx en el lado negativo y sobre la recta y=xy = x en el positivo.

No derivable en el origen

Zonayyy′y'
x<0x < 00000
x=0x = 000indefinida
x>0x > 0xx11

La derivada por la derecha es 11 y por la izquierda es 00, y no coinciden, así que la función no es derivable en el origen. Es continua, de modo que, como el valor absoluto, es un ejemplo de función continua sin ser derivable.

Lejos del origen la derivada es la función escalón de Heaviside2. Recíprocamente, integrar la función escalón da la función rampa.

Convexidad

La función es convexa. Un segmento que una dos puntos de la gráfica queda siempre por encima de ella, y el único doblez gira hacia abajo. Admitiendo traslaciones y múltiplos escalares, las sumas de funciones rampa producen cualquier poligonal convexa. Que toda función convexa lineal a trozos sea una combinación lineal de funciones rampa es el terreno sobre el que se apoyan las aplicaciones.

Integral

La primitiva es la siguiente.

∫max⁡(0, x) dx=12(max⁡(0, x))2+C\int \max(0,\,x)\,dx = \frac{1}{2}\bigl(\max(0,\,x)\bigr)^{2} + C

Vale 00 para x≤0x \leq 0 y x22\dfrac{x^{2}}{2} para x>0x > 0. Esa función es continua y derivable una vez, pero su segunda derivada no coincide en el origen.

FunciónSuavidad en el origen
La función escalón de Heavisidediscontinua
La función rampacontinua pero no derivable
Su primitivaderivable una vez

Cada integración sube la suavidad un escalón, como se ve aquí.

Aplicaciones

En aprendizaje automático esta función se conoce como ReLU y se usa como función de activación, muy extendida porque el gradiente no se desvanece con facilidad ni siquiera a través de muchas capas. Que la red entera se convierta en una función lineal a trozos se sigue de la convexidad y de la superposición que acabamos de describir.

  • La función de activación ReLU del aprendizaje automático
  • El valor de una opción de compra al vencimiento, max⁡(0, S−K)\max(0,\,S-K)
  • La rectificación de media onda, que corta el lado negativo de una corriente alterna
  1. Ramp function, Wikipedia
  2. Heaviside step function, Wikipedia