Ir al contenido
JoaFin

Investigación

De dónde viene el rigor

Esta página no está aquí por vanidad académica. Cuando alguien contrata un modelo que tendrá que defender ante un comité, un regulador o un tribunal, es razonable que quiera saber qué tan profundo va el fundamento de quien lo construye. Aquí está, con las ecuaciones y con enlaces a los documentos originales para quien quiera verificarlo.

Tesis doctoral · Fundador de JoaFin

Four problems in optimal transportation

Degree
Doctorado en Matemáticas · Universidad de Toronto · 2024
Advisor
Director: Robert J. McCann

El transporte óptimo estudia cómo mover una distribución de masa hacia otra al menor costo posible. Es una teoría que vive en la intersección del análisis, la geometría y la probabilidad, y que resulta ser el lenguaje natural de una cantidad sorprendente de problemas aplicados: calibración de superficies de volatilidad, asignación de recursos, emparejamiento en mercados y adaptación de dominio en aprendizaje automático. La tesis aborda cuatro problemas distintos con esa herramienta.

infπΠ(μ,ν) X×Yc(x,y)dπ(x,y)\inf_{\pi \in \Pi(\mu,\nu)}\ \int_{X \times Y} c(x,y)\,d\pi(x,y)
dp(μ,ν)=(infπΠ(μ,ν)M×Md(x,y)pdπ(x,y))1/pd_p(\mu,\nu) = \left( \inf_{\pi \in \Pi(\mu,\nu)} \int_{M \times M} d(x,y)^p \, d\pi(x,y) \right)^{1/p}
(μ0,μ1)q=sup{01 ⁣ ⁣M1q(gab(x)vtavtb)q/2dμt(x)dt},tμt+M ⁣(vtμt)=0\ell(\mu_0,\mu_1)^q = \sup \left\{ \int_0^1\!\!\int_M \frac{1}{q}\bigl( g_{ab}(x)\, v_t^a v_t^b \bigr)^{q/2} d\mu_t(x)\,dt \right\}, \qquad \partial_t \mu_t + \nabla_M \!\cdot (v_t \mu_t) = 0
Leer la tesis (PDF)
Institución
Universidad de Toronto
Año
2024
Director
Robert J. McCann
Problemas
4, en 4 áreas distintas
Artículos
2, de autoría única

Los cuatro problemas

En lenguaje llano, y con la razón por la que cada uno importa fuera de la academia.

01

El problema de Schrödinger relativista no suave

El problema de Schrödinger es la versión con regularización entrópica del transporte óptimo: en lugar de un mapa determinista se busca la ley del puente browniano que interpola dos distribuciones. La tesis extiende el planteamiento a geometrías lorentzianas sintéticas, donde no existe núcleo de calor y los puentes dejan de ser markovianos. Se construyen procesos tipo Lévy que emulan puentes brownianos y se recupera una versión parcial de la convergencia entrópica mediante principios de grandes desviaciones.

Ent(νμ)=Mh ⁣(dνdμ)dμ,h(x)=xlogxx+1\operatorname{Ent}(\nu \mid \mu) = \int_M h\!\left( \frac{d\nu}{d\mu} \right) d\mu, \qquad h(x) = x\log x - x + 1
minπΓ(μ0,μ1)Ent(πr)\min_{\pi \,\in\, \Gamma_{\preceq}(\mu_0,\mu_1)} \operatorname{Ent}(\pi \mid r)
Γ(μ0,μ1)={πP(M2)  :  π(M2)=1,  Proj1#π=μ0,  Proj2#π=μ1}\Gamma_{\preceq}(\mu_0,\mu_1) = \bigl\{ \pi \in \mathcal{P}(M^2) \;:\; \pi\bigl(M^2_{\leq}\bigr) = 1, \ \ \mathrm{Proj}_{1\#}\pi = \mu_0, \ \ \mathrm{Proj}_{2\#}\pi = \mu_1 \bigr\}

Ent es la entropía relativa, r la medida de referencia, y Γ⪯(μ₀,μ₁) el conjunto de planes de transporte causales: la condición π(M²≤) = 1 exige que toda la masa se mueva hacia el futuro causal. Es lo que vuelve físico al problema y lo que rompe la teoría clásica.

Regularización entrópica · Capítulo 1 de la tesis

-2-1012-2-1012xyT
  • ε = 0.5
  • ε = 0.12
  • ε = 0.03
  • T (límite ε → 0)
Cada curva es la proyección baricéntrica del plan entrópico resuelto por iteración de Sinkhorn para un ε distinto. Al disminuir ε, las curvas convergen al mapa de Monge T. Los marginales se satisfacen con precisión de máquina: la convergencia que se ve es real, no ilustrativa.
02

La ecuación de agregación por movimientos minimizantes

Se demuestra existencia a tiempo corto de soluciones con valores en medidas para la ecuación de agregación en variedades riemannianas compactas, con potenciales de interacción no regulares, usando el esquema de movimientos minimizantes (JKO). La dificultad técnica está en la no diferenciabilidad del potencial en el lugar de corte, que se resuelve con las propiedades de propagación de las interpolaciones geodésicas.

tμtM ⁣(μtM(Wμt))=0,W(x,y)=h(d(x,y)2)\partial_t \mu_t - \nabla_M \!\cdot \bigl( \mu_t \, \nabla_M (W * \mu_t) \bigr) = 0, \qquad W(x,y) = h\bigl(d(x,y)^2\bigr)
μk+1τarg minρP(M){EW(ρ)+12τd22(ρ,μkτ)}\mu^{\tau}_{k+1} \in \operatorname*{arg\,min}_{\rho \,\in\, \mathcal{P}(M)} \left\{ E_W(\rho) + \frac{1}{2\tau}\, d_2^{\,2}\bigl(\rho, \mu^{\tau}_k\bigr) \right\}
0<T<δμ2L,δμ=infx,yspt(μ)(x,y)Cut{d(x,x)+d(y,y)}0 < T < \frac{\delta_\mu}{2L}, \qquad \delta_\mu = \inf_{\substack{x,y \,\in\, \mathrm{spt}(\mu) \\ (x',y') \,\in\, \mathrm{Cut}}} \bigl\{ d(x,x') + d(y,y') \bigr\}

W es el potencial de interacción, que depende sólo de la distancia riemanniana; τ es el paso de tiempo; d₂ la métrica de Wasserstein-2; δ_μ la distancia del soporte al lugar de corte y L la constante de Lipschitz de W. La cota de T es explícita: eso es una cota de error, no una nota al pie.

Flujo gradiente · Capítulo 2 de la tesis

0246-2-1012tposición
Forma lagrangiana de la misma ecuación: cada partícula sigue el campo de velocidades v = −∇(W ∗ μ), con W(x,y) = h(d(x,y)²) y h(r) = r/(1+r), integrado por Runge–Kutta de orden 4. La atracción es local, así que la población se concentra en grupos y no en un solo punto. La energía E_W decrece a lo largo del flujo, que es la prueba de que esto es de verdad el flujo gradiente que dice ser.
03

Precondicionamiento de medidas en aprendizaje automático

¿Qué le pasa a un modelo de aprendizaje cuando se modifican ligeramente los datos con los que se entrena? El capítulo demuestra que, si la modificación se hace de cierta forma, hay Γ-convergencia al modelo original —vía un análogo bilateral del lema de Fatou—, con aplicaciones a la adaptación de dominio en transfer learning y a las redes generativas adversarias de Wasserstein.

arg minfC Eπ[L(f(X),Y)]vs.arg minfC Eπn[L(f(X),Y)]\operatorname*{arg\,min}_{f \in \mathcal{C}} \ \mathbf{E}_{\pi}\bigl[ L(f(X), Y) \bigr] \qquad \text{vs.} \qquad \operatorname*{arg\,min}_{f \in \mathcal{C}} \ \mathbf{E}_{\pi_n}\bigl[ L(f(X), Y) \bigr]
lim infnEπn[L(fn(X),Y)]  Eπ[L(f(X),Y)]  lim supjEπj[L(fj(X),Y)]\liminf_{n \to \infty} \mathbf{E}_{\pi_n}\bigl[ L(f_n(X), Y) \bigr] \ \geq \ \mathbf{E}_{\pi}\bigl[ L(f(X), Y) \bigr] \ \geq \ \limsup_{j \to \infty} \mathbf{E}_{\pi_j}\bigl[ L(f_j(X), Y) \bigr]

πₙ es la medida asociada a la muestra y π la verdadera; L la pérdida y f el modelo. Las dos desigualdades son un lema de Fatou bilateral, y son exactamente la condición que hace falta para poder concluir que los minimizadores convergen.

04

Una generalización del modelo de Roy

El modelo de Roy describe cómo se reparte la fuerza laboral entre ocupaciones. La tesis generaliza la versión de Siow tratando la elección ocupacional como restricción y no como consecuencia, lo que permite reescribir el problema de forma analíticamente útil y eliminar el supuesto de que la función separadora es lineal. El modelo no lineal es más realista y sigue admitiendo conclusiones económicas.

sup(ϕ,π,w,μ)C{F(k,μ(k))dHϕ}\sup_{(\phi,\,\pi,\,w,\,\mu) \,\in\, \mathcal{C}} \left\{ \int F\bigl(k, \mu(k)\bigr) \, dH^{\phi} \right\}
F(c,d)+F(a,b)F(a,d)F(c,b)>0whenever a<c, b<dF(c,d) + F(a,b) - F(a,d) - F(c,b) > 0 \qquad \text{whenever } a < c, \ b < d
R ⁣ ⁣ϕ(u)R(u,v)dvdu=12\int_{\mathbb{R}} \!\! \int_{-\infty}^{\phi(u)} R(u,v) \, dv \, du = \frac{1}{2}

F es la función de producción, supermodular estricta; π y w las escalas salariales de cada puesto; φ = w⁻¹ ∘ π la función separadora; R la densidad de habilidades y H^φ la distribución ocupacional que φ induce. La última condición dice que la separación parte la población en dos mitades.

Partición del trabajo · Capítulo 4 de la tesis

12341234kspuesto clavepuesto secundarioφ
  • φ no lineal (este modelo)
  • separación lineal (modelos previos)
Cada punto es un trabajador con un par de habilidades (k, s). La función separadora φ marca la indiferencia entre los dos puestos, y en equilibrio corta la población exactamente por la mitad. Las dos curvas cumplen esa condición —ambas fueron colocadas por bisección hasta dejar la mitad de la masa debajo— y sin embargo reparten a la gente de forma distinta. Eso es lo que se pierde al suponer que la separación es lineal.

Publicaciones

Ambos artículos son de autoría única, escritos durante el doctorado.

Cómo llega esto al trabajo del cliente

La conexión no es metafórica. La calibración de volatilidad local libre de arbitraje se plantea como un problema de transporte óptimo, y es trabajo que en el equipo se hace a diario dentro de una plataforma de analítica de derivados. La asignación de recursos y el emparejamiento en mercados son problemas de transporte. La adaptación de dominio en aprendizaje automático es un problema de transporte. El pronóstico de precios nodales, en cambio, no lo es, y por eso ahí se usan otras herramientas: el criterio para elegir es justamente lo que da una formación así.

Conviene decirlo claro: el transporte óptimo es una herramienta del taller, no el taller entero. El capítulo sobre aprendizaje automático es la raíz de cómo tratamos la estadística y los modelos predictivos; el de Roy, de cómo tratamos los problemas económicos y de identificación. La mayor parte del trabajo de consultoría se resuelve con estadística, series de tiempo, valores extremos y optimización, no con transporte óptimo.

Lo que la investigación deja no es una lista de técnicas, sino un hábito: exigir que el problema esté bien planteado antes de intentar resolverlo, y saber con precisión qué se puede afirmar de una solución y qué no. Eso es lo que se traduce en modelos que resisten el escrutinio.

infT#μ=ν Xc(x,T(x))dμ(x)\inf_{T_\#\mu \,=\, \nu}\ \int_X c\bigl(x,\,T(x)\bigr)\,d\mu(x)

¿Tiene un problema que se resiste a las hojas de cálculo?

Hablemos